Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Embeddings
Licence de recherche Qwen
open_in_new Article de lancement

jina-embeddings-v4

Modèle d'embedding universel pour la recherche multimodale et multilingue
Licence
Qwen Research License
Date de sortie
calendar_month
2025-06-24
Saisie
abc
Texte
image
Image
picture_as_pdf
PDF
arrow_forward
Sortir
more_horiz
Vecteur
apps
Multi-vecteur
Dimensions Matryoshka help_outline
128
256
512
1024
2048
Chunking tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 3.8B
Longueur du token d'entrée: 32K
Taille de l'image d'entrée: 768×28×28
Dimension de sortie: 2048
Modèle de base help_outline
open_in_new
Qwen2.5-VL-3B-Instruct
Langues enseignées help_outline
34 langues
Langues prises en charge help_outline
29 langues
Quantifications help_outline
GGUF
Modèles associés
link
jina-embeddings-v3
link
jina-clip-v2
Tâches prises en charge
search Récupération
compare_arrows Correspondance de texte
code Code
Disponible via
API Jina
Hugging Face
Air-gapped
Graphique d'E/S 1

Texte

jina-embeddings-v4

Tâche

Vecteur

Graphique d'E/S 2

Image

jina-embeddings-v4

Tâche

Vecteur

Graphique d'E/S 3

multiple

Vecteur

Texte

jina-embeddings-v4

Tâche

Graphique d'E/S 4

multiple

Vecteur

Image

jina-embeddings-v4

Tâche

Frontière de Pareto help_outline
workspace_premium
RTEB public
LongEmbed
CoIR
ViDoRe v1
MTEB English · retrieval
chevron_leftchevron_right
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4Paramètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
CoIR
71.59
Paramètres
3.8B
Rang par score
2 / 31
Frontière de Pareto
Derrière
Distribution des valeurshelp_outline
AUC 0.8308
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
Tâche
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Liées6.7%
Négatif difficile1.1%
Non liées0.8%
Seuils recommandés
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
équilibré · 0.618
AUC
0.8308
Plafond de bruit
0.877
Décrochage du rappel
0.516
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.19-0.020.15
σ 0.0221 · 487k valeurs
Géométrie des embeddingshelp_outline
02048
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.496
Dim. effectives
73 / 2048
Troncature des dimensionshelp_outline
12825651210242048
text-matching · Seuil selon les dimensions demandées
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.069
Choisissez les modèles à comparer
Publications (2)
ICLR 2026
janvier 22, 2026
Embedding Compression via Spherical Coordinates
EMNLP 2025
juin 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval

Aperçu

jina-embeddings-v4 est un modèle d'embedding multimodal de 3,8B paramètres qui unifie les représentations texte et image dans une architecture unique. Il prend en charge de manière unique à la fois le mode de sortie mono-vector (dense) et le mode multi-vecteurs (late-interaction/au style ColBERT), permettant aux équipes d'arbitrer entre l'efficacité d'indexation et la précision de récupération sans changer de modèle. Le modèle atteint des performances state-of-the-art sur la récupération de documents visuellement riches, traitant nativement tableaux, graphiques, diagrammes et formats multimédias.

Méthodes

L'architecture combine un grand backbone d'encodeur transformer avec un vision encoder basé sur Qwen2.5-VL, traitant le texte (jusqu'à 32K tokens) et les images (768×28×28 patches) à travers des couches d'attention partagées. Trois adaptateurs LoRA spécifiques à chaque tâche (60M paramètres chacun) spécialisent le modèle pour : la récupération asymétrique requête-document, la similarité sémantique de texte et la recherche de code. La conception de double sortie est l'innovation clé : le modèle peut produire un unique vecteur dense de 2048 dimensions (pour un indexage ANN rapide avec troncature Matryoshka à 128 dimensions) ou un ensemble de vecteurs de 128 dimensions au niveau des tokens pour le scoring late-interaction. L'entraînement a utilisé un cursus en deux étapes : pré-entraînement contrastif conjoint sur des paires texte-image et texte-texte, suivi d'un entraînement des adaptateurs LoRA spécifiques à chaque tâche. Le late chunking est pris en charge pour les documents dépassant la fenêtre de contexte de 32K tokens. La Qwen Research License s'applique.

Performance

Sur JinaVDR (Visual Document Retrieval), le modèle marque 72,19 en moyenne, contre 64,50 pour ColPali-v1.2. Sur ViDoRe, il atteint 84,11 en moyenne (90,17 en mode multi-vector) contre 83,90 pour ColPali. La récupération cross-modal atteint 84,11 sur le benchmark CLIP, dépassant jina-clip-v2 (81,12) et nllb-clip-large-siglip (83,19). Scores de récupération de texte : 55,97 sur MTEB-en, 66,49 sur MMTEB, 67,11 sur LongEmbed (contre 55,66 pour jina-embeddings-v3). La similarité sémantique atteint 85,89 sur STS anglais et 72,70 sur STS multilingue. La récupération de code obtient 71,59 sur CoIR. L'alignement cross-modal atteint une similarité cosinus de 0,71 (contre 0,15 pour OpenAI CLIP). Le mode multi-vector surpasse de façon constante le mode single-vector sur les tâches visuellement riches ; le mode single-vector offre des performances efficaces pour la récupération de texte standard.

Conseils

Choisissez le mode de sortie selon votre pipeline : mono-vector pour l'indexage ANN à grande échelle (troncature Matryoshka à 128–512 dimensions disponible), multi-vector pour le re-classement des candidats top-k sur des documents visuellement riches. Sélectionnez l'adaptateur LoRA via le paramètre de tâche de l'API : 'retrieval' pour la recherche requête-document, 'text-matching' pour la similarité sémantique, 'code' pour la récupération de code. Pour les documents dépassant 32K tokens, utilisez `late_chunking. Le surcoût de 60M paramètres par adaptateur LoRA est négligeable (<2 % d'augmentation mémoire) et les trois adaptateurs peuvent être chargés simultanément. Le modèle est sous licence Qwen Research License (usage non commercial sans licence commerciale). Pour les déploiements de production, utilisez des GPU compatibles CUDA ; le modèle est disponible via Jina API, AWS, Azure et marketplaces GCP. Pour les charges de travail uniquement textuelles, jina-embeddings-v5-text-small` offre une meilleure précision par paramètre à une fraction du coût de calcul.

Blogs qui mentionnent ce modèle
mars 11, 2026 • 7 minutes lues
Bootstrapping d'embeddings audio à partir de LLM multimodaux
Transformez n'importe quel LLM multimodal en un petit modèle de plongements audio qui surpasse CLAP avec 25 fois moins de données.
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
février 19, 2026 • 7 minutes lues
jina-embeddings-v5-text : Nouveaux Embeddings multilingues de petite taille SOTA
Deux modèles de plongements (embeddings) multilingues de moins de 1 milliard de paramètres offrant des performances de premier ordre, disponibles sur Elastic Inference Service, Llama.cpp et MLX.
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
septembre 09, 2025 • 11 minutes lues
Les Embeddings multimodaux dans Llama.cpp et GGUF
Nous avons intégré les 向量模型 multimodaux à llama.cpp et GGUF, et découvert quelques problèmes surprenants en cours de route.
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
septembre 04, 2025 • 6 minutes lues
Jina Code Embeddings : Recherche de code SOTA à 0,5B et 1,5B
Génération de LLM de code → Vecteurs modèles de code : les modèles 0.5B/1.5B atteignent une performance SOTA sur 25 benchmarks de récupération de code.
Jina AI
Green "Code Embeddings" text displayed in a LED dot style on a black background, evoking a futuristic and technological atmos
août 13, 2025 • 15 minutes lues
Optimisation des GGUF pour les modèles de 向量模型 à décodeur uniquement
4000词元/秒 pour un modèle de 向量模型 de 3 milliards de paramètres sur GPU L4 est probablement la vitesse maximale que vous obtiendrez avec llama.cpp. Ou pas ?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.