Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Embeddings
copyright CC BY-NC 4.0
open_in_new Article de lancement

jina-clip-v2

Embeddings multilingues multimodaux pour textes et images
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2024-11-05
Saisie
image
Image
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Dimensions Matryoshka help_outline
64
128
256
512
768
1024
Détails du modèle
Paramètres: 865M
Longueur du token d'entrée: 8K
Taille de l'image d'entrée: 512×512
Dimension de sortie: 1024
Modèle de base help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
Langues enseignées help_outline
32 langues
Langues prises en charge help_outline
108 langues
Modèles associés
link
jina-clip-v1
Disponible via
Elastic Inference Service
API Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Graphique d'E/S 1

Texte

jina-clip-v2

Vecteur

Graphique d'E/S 2

Image

jina-clip-v2

Vecteur

Frontière de Paretohelp_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2Paramètres (log)i2t-recall@5
Ce modèle
Sur la frontière
Jina AI
Autres
CLIP Benchmark
89.73
Paramètres
865M
Rang par score
34 / 56
Frontière de Pareto
Derrière
Distribution des valeurshelp_outline
AUC 0.8383
Corpus
Paires de traduction
Recherche documentaire
Image / bannière
Image / logo
Tâche
default
retrieval.query
0.6040.000.200.400.60
Liées20.2%
Négatif difficile3.6%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
équilibré · 0.403
AUC
0.8383
Plafond de bruit
0.666
Décrochage du rappel
0.224
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.43-0.070.29
σ 0.0313 · 244k valeurs
Géométrie des embeddingshelp_outline
01024
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.420
Dim. effectives
52 / 1024
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.064
Choisissez les modèles à comparer
Publications (2)
ICLR 2026
janvier 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
décembre 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

Aperçu

jina-clip-v2 est un modèle d'embedding multimodal multilingue de 865M paramètres, prenant en charge 89 langues et l'entrée d'images 512×512. Il étend jina-clip-v1 avec l'alignement image-texte entre langues, l'apprentissage de représentation Matryoshka pour la réduction de dimensions (1024→64) et de meilleures performances sur les documents visuellement riches. Il atteint un état de l'art en recherche d'images interlingue tout en maintenant de solides performances texte uniquement et mono-modalité.

Méthodes

Le modèle emploie une architecture à double encodeur combinant un encodeur de texte Jina XLM-RoBERTa (561M paramètres, 89 langues, contexte de 696 320 tokens) avec un encodeur visuel EVA02-L14 (304M paramètres, entrée 512×512 pixels). L'entraînement utilise un paradigme d'apprentissage contrastif multi-tâches et multi-étapes : le modèle est entraîné simultanément sur des paires de texte, des triplets de texte et des paires image-texte pour supporter à la fois les tâches texte uniquement et cross-modales. Le jeu de données d'entraînement a été étendu pour inclure des textes multilingues de 29 langues non anglaises (dont hindi, chinois, allemand, français) et des images de documents visuellement riches. L'apprentissage de représentation Matryoshka permet de réduire la dimension des embeddings de 1024 à 64 dimensions tout en conservant plus de 99 % des performances. Le modèle utilise Last-Token-Pooling pour l'embedding final.

Performance

Le modèle atteint 98,0 % de précision sur la recherche image-vers-texte Flickr30k, dépassant à la fois jina-clip-v1 et NLLB-CLIP-SigLIP. Dans les scénarios multilingues, il montre jusqu'à 4 % d'amélioration par rapport à NLLB-CLIP-SigLIP en recherche d'images cross-lingual. La compression des embeddings est remarquablement efficace : réduire les dimensions de 75 % (1024→256) conserve toujours plus de 99 % des performances sur les tâches texte, image et cross-modales. Sur Multilingual MTEB, il atteint 69,86 % en recherche et 67,77 % en similarité sémantique, avec des performances compétitives face aux modèles d'embedding de texte spécialisés. Le support de 89 langues et le traitement des documents visuellement riches le rendent particulièrement adapté au e-commerce mondial et à la gestion de contenu.

Conseils

Redimensionnez les images en 512×512 pixels avant traitement — les images plus grandes sont automatiquement découpées en tuiles, ce qui augmente l'utilisation de tokens et le temps de traitement. Le modèle excelle à faire correspondre les images avec du texte descriptif dans 89 langues, idéal pour la recherche de produits e-commerce mondiale, la recommandation de contenu et la recherche visuelle multilingue. Il peut avoir des difficultés avec les concepts abstraits ou les contenus de domaines très spécialisés. Lors de l'utilisation de la réduction de dimensions Matryoshka, des embeddings de 64 dimensions maintiennent de bonnes performances pour l'indexation ; utilisez 512+ dimensions pour le re-ranking d'applications critiques. Le modèle nécessite du matériel compatible CUDA. Pour les charges de travail texte uniquement, jina-embeddings-v5-text-small offre une meilleure précision par paramètre. Pour la recherche de code, utilisez jina-code-embeddings-1.5b. Disponible via Jina API, AWS, Azure et les marketplaces GCP.

Blogs qui mentionnent ce modèle
juillet 31, 2025 • 12 minutes lues
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
juillet 25, 2025 • 8 minutes lues
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
mai 28, 2025 • 4 minutes lues
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
mai 25, 2025 • 21 minutes lues
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.