Graphique d'E/S 1

Texte

jina-clip-v2

Vecteur

Graphique d'E/S 2

Image

jina-clip-v2

Vecteur

Frontière de Pareto
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Paramètres (log)i2t-recall@5
Ce modèle
Sur la frontière
Jina AI
Autres
CLIP Benchmark
89.73
Paramètres
865M
Rang par score
34 / 56
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.8383
Corpus
Paires de traduction
Recherche documentaire
Image / bannière
Image / logo
Tâche
default
retrieval.query
0.6040.000.200.400.60
Liées20.2%
Négatif difficile3.6%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
équilibré · 0.403
AUC
0.8383
Plafond de bruit
0.666
Décrochage du rappel
0.224
Paires mesurées
119 / 11k
Composantes des vecteurs
-0.43-0.070.29
σ 0.0313 · 244k valeurs
Géométrie des embeddings
01024
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.420
Dim. effectives
52 / 1024
Paires de langues
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.064
Choisissez les modèles à comparer
Publications (2)

Aperçu

jina-clip-v2 est un modèle d'embedding multimodal multilingue de 865M paramètres, prenant en charge 89 langues et l'entrée d'images 512×512. Il étend jina-clip-v1 avec l'alignement image-texte entre langues, l'apprentissage de représentation Matryoshka pour la réduction de dimensions (1024→64) et de meilleures performances sur les documents visuellement riches. Il atteint un état de l'art en recherche d'images interlingue tout en maintenant de solides performances texte uniquement et mono-modalité.

Méthodes

Le modèle emploie une architecture à double encodeur combinant un encodeur de texte Jina XLM-RoBERTa (561M paramètres, 89 langues, contexte de 696 320 tokens) avec un encodeur visuel EVA02-L14 (304M paramètres, entrée 512×512 pixels). L'entraînement utilise un paradigme d'apprentissage contrastif multi-tâches et multi-étapes : le modèle est entraîné simultanément sur des paires de texte, des triplets de texte et des paires image-texte pour supporter à la fois les tâches texte uniquement et cross-modales. Le jeu de données d'entraînement a été étendu pour inclure des textes multilingues de 29 langues non anglaises (dont hindi, chinois, allemand, français) et des images de documents visuellement riches. L'apprentissage de représentation Matryoshka permet de réduire la dimension des embeddings de 1024 à 64 dimensions tout en conservant plus de 99 % des performances. Le modèle utilise Last-Token-Pooling pour l'embedding final.

Performance

Le modèle atteint 98,0 % de précision sur la recherche image-vers-texte Flickr30k, dépassant à la fois jina-clip-v1 et NLLB-CLIP-SigLIP. Dans les scénarios multilingues, il montre jusqu'à 4 % d'amélioration par rapport à NLLB-CLIP-SigLIP en recherche d'images cross-lingual. La compression des embeddings est remarquablement efficace : réduire les dimensions de 75 % (1024→256) conserve toujours plus de 99 % des performances sur les tâches texte, image et cross-modales. Sur Multilingual MTEB, il atteint 69,86 % en recherche et 67,77 % en similarité sémantique, avec des performances compétitives face aux modèles d'embedding de texte spécialisés. Le support de 89 langues et le traitement des documents visuellement riches le rendent particulièrement adapté au e-commerce mondial et à la gestion de contenu.

Conseils

Redimensionnez les images en 512×512 pixels avant traitement — les images plus grandes sont automatiquement découpées en tuiles, ce qui augmente l'utilisation de tokens et le temps de traitement. Le modèle excelle à faire correspondre les images avec du texte descriptif dans 89 langues, idéal pour la recherche de produits e-commerce mondiale, la recommandation de contenu et la recherche visuelle multilingue. Il peut avoir des difficultés avec les concepts abstraits ou les contenus de domaines très spécialisés. Lors de l'utilisation de la réduction de dimensions Matryoshka, des embeddings de 64 dimensions maintiennent de bonnes performances pour l'indexation ; utilisez 512+ dimensions pour le re-ranking d'applications critiques. Le modèle nécessite du matériel compatible CUDA. Pour les charges de travail texte uniquement, jina-embeddings-v5-text-small offre une meilleure précision par paramètre. Pour la recherche de code, utilisez jina-code-embeddings-1.5b. Disponible via Jina API, AWS, Azure et les marketplaces GCP.

Blogs qui mentionnent ce modèle
juillet 31, 2025 • 12 minutes lues
L'impact de la résolution d'image sur la recherche de documents visuels
La résolution d'image est cruciale pour l'intégration de documents riches en visuels dans des vecteurs modèles. Si elle est trop petite, les modèles passent à côté de détails importants ; si elle est trop grande, ils ne peuvent pas connecter les parties.
juillet 25, 2025 • 8 minutes lues
JinaVDR : Nouvelle référence d'évaluation pour la recherche de documents visuels avec 95 tâches dans 20 langues
JinaVDR est une nouvelle référence comprenant 95 tâches dans 20 langues pour la recherche de documents visuels, bientôt disponible sur MTEB.
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4 : Vecteurs universels pour la recherche multimodale et multilingue
Jina Embeddings v4 est un modèle d'向量模型 (Embeddings) universel de 3,8 milliards de paramètres pour la recherche multimodale et multilingue qui prend en charge les sorties d'向量模型 (Embeddings) à vecteur unique et à vecteurs multiples.
mai 28, 2025 • 4 minutes lues
Corrélations : Tester l’ambiance des vecteurs modèles (Embeddings) dans l’interface utilisateur graphique (GUI)
Aussi sérieux que nous soyons au sujet de MTEB, nous aimons également tester l'ambiance. Correlations est une simple interface graphique que nous utilisons pour valider les citations dans DeepSearch, déboguer le chunking tardif et tester l'ambiance des 向量模型 (Embeddings). Maintenant, c'est open source.
mai 25, 2025 • 21 minutes lues
Ce que nous avons appris à ICLR2025
Nous avons rassemblé quelques-uns des articles les plus intéressants de l'ICLR 2025, notamment TIPS, FlexPrefill, les réordonnateurs zéro-shot (Zero-Shot Rerankers), SVD-LLM, Hymba, etc.