Aperçu
jina-clip-v2 est un modèle d'embedding multimodal multilingue de 865M paramètres, prenant en charge 89 langues et l'entrée d'images 512×512. Il étend jina-clip-v1 avec l'alignement image-texte entre langues, l'apprentissage de représentation Matryoshka pour la réduction de dimensions (1024→64) et de meilleures performances sur les documents visuellement riches. Il atteint un état de l'art en recherche d'images interlingue tout en maintenant de solides performances texte uniquement et mono-modalité.
Méthodes
Le modèle emploie une architecture à double encodeur combinant un encodeur de texte Jina XLM-RoBERTa (561M paramètres, 89 langues, contexte de 696 320 tokens) avec un encodeur visuel EVA02-L14 (304M paramètres, entrée 512×512 pixels). L'entraînement utilise un paradigme d'apprentissage contrastif multi-tâches et multi-étapes : le modèle est entraîné simultanément sur des paires de texte, des triplets de texte et des paires image-texte pour supporter à la fois les tâches texte uniquement et cross-modales. Le jeu de données d'entraînement a été étendu pour inclure des textes multilingues de 29 langues non anglaises (dont hindi, chinois, allemand, français) et des images de documents visuellement riches. L'apprentissage de représentation Matryoshka permet de réduire la dimension des embeddings de 1024 à 64 dimensions tout en conservant plus de 99 % des performances. Le modèle utilise Last-Token-Pooling pour l'embedding final.
Performance
Le modèle atteint 98,0 % de précision sur la recherche image-vers-texte Flickr30k, dépassant à la fois jina-clip-v1 et NLLB-CLIP-SigLIP. Dans les scénarios multilingues, il montre jusqu'à 4 % d'amélioration par rapport à NLLB-CLIP-SigLIP en recherche d'images cross-lingual. La compression des embeddings est remarquablement efficace : réduire les dimensions de 75 % (1024→256) conserve toujours plus de 99 % des performances sur les tâches texte, image et cross-modales. Sur Multilingual MTEB, il atteint 69,86 % en recherche et 67,77 % en similarité sémantique, avec des performances compétitives face aux modèles d'embedding de texte spécialisés. Le support de 89 langues et le traitement des documents visuellement riches le rendent particulièrement adapté au e-commerce mondial et à la gestion de contenu.
Conseils
Redimensionnez les images en 512×512 pixels avant traitement — les images plus grandes sont automatiquement découpées en tuiles, ce qui augmente l'utilisation de tokens et le temps de traitement. Le modèle excelle à faire correspondre les images avec du texte descriptif dans 89 langues, idéal pour la recherche de produits e-commerce mondiale, la recommandation de contenu et la recherche visuelle multilingue. Il peut avoir des difficultés avec les concepts abstraits ou les contenus de domaines très spécialisés. Lors de l'utilisation de la réduction de dimensions Matryoshka, des embeddings de 64 dimensions maintiennent de bonnes performances pour l'indexation ; utilisez 512+ dimensions pour le re-ranking d'applications critiques. Le modèle nécessite du matériel compatible CUDA. Pour les charges de travail texte uniquement, jina-embeddings-v5-text-small offre une meilleure précision par paramètre. Pour la recherche de code, utilisez jina-code-embeddings-1.5b. Disponible via Jina API, AWS, Azure et les marketplaces GCP.











