Aperçu
jina-embeddings-v5-text-nano est un modèle d'embeddings de texte multilingue de 239M paramètres construit sur le backbone EuroBERT-210M. Il prend en charge un contexte de 8K tokens, produit des embeddings de 768 dimensions avec troncature Matryoshka jusqu'à 32 dimensions et offre la meilleure précision par paramètre de la famille d'embeddings sub-500M de Jina. Conçu pour les déploiements edge, les applications sensibles à la latence et les environnements à ressources limitées où un GPU complet n'est pas disponible.
Méthodes
Le modèle est construit sur EuroBERT-210M, un encodeur bidirectionnel compact pré-entraîné sur des données multilingues couvrant 15 langues principales. Il emploie le Last-Token-Pooling pour générer des embeddings à partir de la représentation du token final. L'entraînement suit une recette de distillation en deux étapes : d'abord, la distillation de connaissance depuis un modèle maître plus grand transfère la qualité d'embedding ; ensuite, une perte contrastive spécifique aux tâches affine le modèle sur la récupération, la correspondance de texte, le regroupement et la classification. Matryoshka Representation Learning permet de tronquer les dimensions d'embedding à toute taille supportée (32, 64, 128, 256, 512, 768) en maintenant de bonnes performances. Geometric Orthogonal Regularization (GOR) limite la dégradation de performance sous quantification binaire à moins de 2 points sur MTEB retrieval. La fenêtre de contexte de 8K permet le traitement de documents longs sans chunking.
Performance
Sur MMTEB (multilingue), le modèle atteint 65,5 de moyenne (niveau tâche) et 57,7 de moyenne (niveau type) avec seulement 239M de paramètres, surpassant tous les modèles sous 500M, dont KaLM-mini-v2.5 (60,1, 494M), voyage-4-nano (58,9, 480M) et Gemma-300M (61,1, 308M). Scores au niveau tâche : classification 69,2, regroupement 52,7, classification de paires 81,9, reranking 64,6, récupération 63,3, STS 78,2. Sur MTEB en anglais, il atteint 71,0 de moyenne, se rapprochant presque du bien plus grand jina-embeddings-v5-text-small (71,7). Spécifique à la récupération : 63,26 sur MTEB-M, 64,08 sur RTEB, 56,06 sur BEIR, 63,65 sur LongEmbed. Les embeddings restent robustes sous quantification binaire grâce à la régularisation GOR.
Conseils
Sélectionnez le préfixe de tâche approprié : 'retrieval' pour la recherche asymétrique query-document, 'text-matching' pour la similarité symétrique, 'clustering' pour le regroupement, 'classification' pour la catégorisation. La troncature Matryoshka à 256 dimensions préserve plus de 95% de la qualité de récupération tout en réduisant le stockage de 67%. La quantification binaire est prise en charge pour une réduction de stockage supplémentaire. Le backbone EuroBERT offre une forte couverture pour 15 langues principales, dont l'anglais, le français, l'allemand, l'espagnol, le chinois, le japonais, l'arabe et le hindi. Utilisez la similarité cosinus pour comparer les embeddings. Disponible via l'API Jina AI, Hugging Face (Sentence Transformers, vLLM) et des variantes quantifiées pour llama.cpp. Pour les charges nécessitant un contexte de 32K ou une précision supérieure, utilisez plutôt jina-embeddings-v5-text-small.






