Graphique d'E/S 1

Texte

jina-embeddings-v4

Tâche

Vecteur

Graphique d'E/S 2

Image

jina-embeddings-v4

Tâche

Vecteur

Graphique d'E/S 3

multiple

Vecteur

Texte

jina-embeddings-v4

Tâche

Graphique d'E/S 4

multiple

Vecteur

Image

jina-embeddings-v4

Tâche

Frontière de Pareto
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4Paramètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
CoIR
71.59
Paramètres
3.8B
Rang par score
2 / 31
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.8308
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
Tâche
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Liées6.7%
Négatif difficile1.1%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
équilibré · 0.618
AUC
0.8308
Plafond de bruit
0.877
Décrochage du rappel
0.516
Paires mesurées
119 / 11k
Composantes des vecteurs
-0.19-0.020.15
σ 0.0221 · 487k valeurs
Géométrie des embeddings
02048
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.496
Dim. effectives
73 / 2048
Troncature des dimensions
12825651210242048
text-matching · Seuil selon les dimensions demandées
Paires de langues
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.069
Choisissez les modèles à comparer
Publications (2)

Aperçu

jina-embeddings-v4 est un modèle d'embedding multimodal de 3,8B paramètres qui unifie les représentations texte et image dans une architecture unique. Il prend en charge de manière unique à la fois le mode de sortie mono-vector (dense) et le mode multi-vecteurs (late-interaction/au style ColBERT), permettant aux équipes d'arbitrer entre l'efficacité d'indexation et la précision de récupération sans changer de modèle. Le modèle atteint des performances state-of-the-art sur la récupération de documents visuellement riches, traitant nativement tableaux, graphiques, diagrammes et formats multimédias.

Méthodes

L'architecture combine un grand backbone d'encodeur transformer avec un vision encoder basé sur Qwen2.5-VL, traitant le texte (jusqu'à 32K tokens) et les images (768×28×28 patches) à travers des couches d'attention partagées. Trois adaptateurs LoRA spécifiques à chaque tâche (60M paramètres chacun) spécialisent le modèle pour : la récupération asymétrique requête-document, la similarité sémantique de texte et la recherche de code. La conception de double sortie est l'innovation clé : le modèle peut produire un unique vecteur dense de 2048 dimensions (pour un indexage ANN rapide avec troncature Matryoshka à 128 dimensions) ou un ensemble de vecteurs de 128 dimensions au niveau des tokens pour le scoring late-interaction. L'entraînement a utilisé un cursus en deux étapes : pré-entraînement contrastif conjoint sur des paires texte-image et texte-texte, suivi d'un entraînement des adaptateurs LoRA spécifiques à chaque tâche. Le late chunking est pris en charge pour les documents dépassant la fenêtre de contexte de 32K tokens. La Qwen Research License s'applique.

Performance

Sur JinaVDR (Visual Document Retrieval), le modèle marque 72,19 en moyenne, contre 64,50 pour ColPali-v1.2. Sur ViDoRe, il atteint 84,11 en moyenne (90,17 en mode multi-vector) contre 83,90 pour ColPali. La récupération cross-modal atteint 84,11 sur le benchmark CLIP, dépassant jina-clip-v2 (81,12) et nllb-clip-large-siglip (83,19). Scores de récupération de texte : 55,97 sur MTEB-en, 66,49 sur MMTEB, 67,11 sur LongEmbed (contre 55,66 pour jina-embeddings-v3). La similarité sémantique atteint 85,89 sur STS anglais et 72,70 sur STS multilingue. La récupération de code obtient 71,59 sur CoIR. L'alignement cross-modal atteint une similarité cosinus de 0,71 (contre 0,15 pour OpenAI CLIP). Le mode multi-vector surpasse de façon constante le mode single-vector sur les tâches visuellement riches ; le mode single-vector offre des performances efficaces pour la récupération de texte standard.

Conseils

Choisissez le mode de sortie selon votre pipeline : mono-vector pour l'indexage ANN à grande échelle (troncature Matryoshka à 128–512 dimensions disponible), multi-vector pour le re-classement des candidats top-k sur des documents visuellement riches. Sélectionnez l'adaptateur LoRA via le paramètre de tâche de l'API : 'retrieval' pour la recherche requête-document, 'text-matching' pour la similarité sémantique, 'code' pour la récupération de code. Pour les documents dépassant 32K tokens, utilisez `late_chunking. Le surcoût de 60M paramètres par adaptateur LoRA est négligeable (<2 % d'augmentation mémoire) et les trois adaptateurs peuvent être chargés simultanément. Le modèle est sous licence Qwen Research License (usage non commercial sans licence commerciale). Pour les déploiements de production, utilisez des GPU compatibles CUDA ; le modèle est disponible via Jina API, AWS, Azure et marketplaces GCP. Pour les charges de travail uniquement textuelles, jina-embeddings-v5-text-small` offre une meilleure précision par paramètre à une fraction du coût de calcul.

Blogs qui mentionnent ce modèle