Graphique d'E/S
Frontière de Paretohelp_outline
chevron_leftchevron_right
Ce modèle
Sur la frontière
Jina AI
Autres
LongEmbed
63.65
Paramètres
212M
Rang par score
14 / 69
Frontière de Pareto
Derrière
Distribution des valeurshelp_outlineAUC 0.8242
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
Tâche
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Liées20.2%
Négatif difficile1.7%
Non liées1.1%
Seuils recommandés
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
équilibré · 0.678
AUC
0.8242
Plafond de bruit
0.840
Décrochage du rappel
0.557
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.288
Dim. effectives
69 / 768
Troncature des dimensionshelp_outline
text-matching · Seuil selon les dimensions demandées
Paires de langueshelp_outline
Écart du seuil entre les paires : 0.027
Choisissez les modèles à comparer
Publications (1)
Aperçu
jina-embeddings-v5-text-nano est un modèle d'embedding de texte multilingue de 239 millions de paramètres, construit sur l'architecture EuroBERT-210M, un encodeur bidirectionnel pré-entraîné sur 15 langues européennes et mondiales majeures. Il produit des embeddings de dimension 768 par regroupement des derniers tokens et prend en charge des contextes jusqu'à 32 000 tokens. Le modèle inclut quatre adaptateurs LoRA dédiés à la recherche, à la similarité sémantique, au clustering et à la classification (6,7 millions de paramètres chacun). L'apprentissage par représentation Matryoshka permet de réduire la dimension des embeddings à 32. Entraîné par distillation des embeddings de Qwen3-Embedding-4B, suivie d'un entraînement spécifique à chaque tâche, le modèle atteint des performances comparables à celles de modèles deux fois plus volumineux, ce qui le rend idéal pour les environnements à faible latence et les déploiements en périphérie de réseau.
Méthodes
L'entraînement suit le même processus en deux étapes que jina-embeddings-v5-text-small, mais appliqué à l'architecture EuroBERT-210M. La première étape, la distillation des embeddings, transfère les connaissances de Qwen3-Embedding-4B à l'aide d'une perte de distance cosinus et d'une couche de projection linéaire qui transforme les embeddings de dimension 768 de l'apprenant dans l'espace de l'enseignant. L'entraînement utilise diverses paires de textes multilingues issues de plus de 300 jeux de données. Dans la seconde étape, quatre adaptateurs LoRA spécifiques à la tâche (6,7 millions de paramètres chacun) sont entraînés sur les poids de l'architecture initiale : recherche (InfoNCE + distillation + GOR), correspondance de textes (CoSENT + distillation), clustering (re-distillation avec instructions spécifiques à la tâche pour l'enseignant) et classification (InfoNCE bidirectionnel + distillation des connaissances relationnelles). L'architecture EuroBERT offre une couverture multilingue étendue à 15 langues européennes et mondiales majeures, dont l'anglais, le français, l'allemand, l'espagnol, le chinois, le japonais, l'arabe et l'hindi.
Performance
Sur MMTEB (multilingue), jina-embeddings-v5-text-nano atteint une moyenne de 65,5 (niveau tâche) et de 57,7 (niveau type) avec seulement 239 millions de paramètres, surpassant tous les modèles de moins de 500 millions de paramètres, y compris KaLM-mini-v2.5 (60,1, 494 M de paramètres), voyage-4-nano (58,9, 480 M de paramètres) et Gemma-300M (61,1, 308 M de paramètres). Ses scores sont de 69,2 en classification, 52,7 en clustering, 81,9 en classification par paires, 64,6 en reranking, 63,3 en recherche et 78,2 en STS. Sur MTEB anglais, il atteint une moyenne de 71,0, un résultat presque identique à celui de jina-embeddings-v5-text-small (71,7), un modèle beaucoup plus volumineux. Sur les benchmarks de recherche, il obtient 63,26 sur MTEB-M, 64,08 sur RTEB, 56,06 sur BEIR et 63,65 sur LongEmbed. Les embeddings restent robustes sous quantification binaire, la régularisation GOR limitant la dégradation des performances à moins de 2 points sur MTEB retrieval.
Conseils
Sélectionnez l'adaptateur LoRA approprié à votre tâche : « retrieval » pour la recherche asymétrique requête-document (ajoutez « Query: » aux requêtes et « Document: » aux passages), « text-matching » pour les tâches de similarité symétriques (utilisez le préfixe « Document: » pour les deux entrées), « clustering » pour le regroupement de documents apparentés et « classification » pour la catégorisation. Le modèle nano est optimisé pour les déploiements sensibles à la latence et aux ressources limitées, tout en conservant une précision comparable à celle de modèles deux fois plus volumineux. La troncature Matryoshka permet de réduire la dimensionnalité des embeddings de 768 à 32 dimensions ; pour des résultats optimaux, conservez une dimensionnalité supérieure à 256. La quantification binaire est prise en charge. L'architecture EuroBERT offre une couverture étendue pour 15 langues majeures, dont l'anglais, le français, l'allemand, l'espagnol, le chinois, le japonais, l'arabe et l'hindi. Utilisez la similarité cosinus pour la comparaison des embeddings. Disponible via l'API Jina AI, Hugging Face (Sentence Transformers et vLLM) et des variantes quantifiées pour llama.cpp.
Blogs qui mentionnent ce modèle





