Graphique d'E/S

Texte

jina-embeddings-v2-base-en

Vecteur

Frontière de Pareto
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxlParamètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
MTEB English · retrieval
49.05
Paramètres
137M
Rang par score
17 / 39
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.8376
Corpus
Paires de traduction
Recherche documentaire
0.8500.600.700.800.90
Liées26.9%
Négatif difficile2.7%
Non liées1.1%
Seuils recommandés
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
équilibré · 0.762
AUC
0.8376
Plafond de bruit
0.893
Décrochage du rappel
0.691
Paires mesurées
119 / 11k
Composantes des vecteurs
-0.14-0.000.14
σ 0.0361 · 183k valeurs
Géométrie des embeddings
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.751
Dim. effectives
59 / 768
Choisissez les modèles à comparer
Publications (1)

Aperçu

jina-embeddings-v2-base-en est un modèle d'embedding de texte anglais de 137M paramètres avec une fenêtre de contexte de 8 192 tokens — 16 fois la limite standard de 512 tokens de son époque. Construit sur un backbone BERT-small avec ALiBi bidirectionnelle symétrique (Attention with Linear Biases), c'était le premier embedding Jina open source à traiter nativement des documents longs sans troncature ni découpage. Il produit des vecteurs de 768 dimensions et reste un choix solide pour la recherche uniquement en anglais lorsque les fonctions multilingues ou de long contexte de v3/v5 ne sont pas nécessaires.

Méthodes

L'architecture associe un transformeur BERT-small (12 couches, 12 têtes d'attention, 768 dimensions cachées) à des encodings positionnels ALiBi bidirectionnels symétriques. ALiBi remplace les embeddings positionnels appris par un biais d'attention décroissant linéairement, permettant au modèle d'extrapoler bien au-delà de sa longueur d'entraînement de 512 tokens jusqu'à 8 192 tokens sans dégradation des performances. L'entraînement a suivi un pipeline en deux étapes : pré-entraînement sur C4, puis ajustement fin sur la collection curée de Jina de 40+ jeux de données de paires de phrases spécialisées, avec minage de négatifs difficiles. L'attention bidirectionnelle symétrique garantit que chaque token prête attention à la fois au contexte précédent et suivant, produisant des représentations capturant le sens global de la phrase. Le pooling moyen sur toutes les représentations de tokens produit l'embedding final de 768 dimensions.

Performance

Au moment de sa publication, le modèle a surpassé text-embedding-ada-002 d'OpenAI sur plusieurs sous-tâches MTEB en anglais : classification (73,45 % vs 70,93 %), réordonnancement (85,38 % vs 84,89 %), recherche (56,98 % vs 56,32 %) et résumé (31,6 % vs 30,8 %). Son contexte de 8 192 tokens fut un avantage considérable face aux modèles concurrents limités à 512–2 048 tokens, permettant la recherche au niveau document sans découpage. L'empreinte compacte de 307Mo le rendit déployable sur des GPU de grand public. En 2026, jina-embeddings-v5-text-small (677M paramètres, contexte de 32K, adaptateurs LoRA spécifiques aux tâches) le surpasse pour la plupart des charges de travail de production, mais il reste pertinent pour les pipelines légers uniquement en anglais.

Conseils

Utilisez ce modèle pour la recherche uniquement en anglais lorsque la fenêtre de contexte de 8K est suffisante et que des adaptateurs multilingues ou spécifiques aux tâches ne sont pas requis. Pour les documents dépassant 8 192 tokens, appliquez le découpage sémantique avant l'embedding. Le modèle s'intègre avec les principales bases de données vectorielles (Qdrant, Weaviate, MongoDB Atlas, Milvus) et les frameworks RAG (LangChain, LlamaIndex, Haystack). Pour les nouveaux projets nécessitant un support multilingue, un contexte de 32K ou une optimisation spécifique aux tâches, préférez jina-embeddings-v5-text-small. Une GPU compatible CUDA est recommandée pour le débit en production ; l'inférence CPU est possible mais nettement plus lente.

Blogs qui mentionnent ce modèle
décembre 17, 2024 • 12 minutes lues
Les embeddings textuels échouent à capturer l'ordre des mots et comment y remédier
Les modèles d'intégration de texte peinent à capturer les nuances linguistiques subtiles comme l'ordre des mots, les relations directionnelles, les séquences temporelles, les liens de causalité, les comparaisons et la négation. Comprendre ces défis est essentiel pour améliorer les performances des modèles.
octobre 25, 2024 • 19 minutes lues
Trouver les points de coupure optimaux dans les longs documents à l'aide de petits modèles de langage
Nous avons entraîné trois petits modèles de langage pour mieux segmenter les longs documents en fragments, et voici les leçons essentielles que nous avons apprises.
octobre 15, 2024 • 9 minutes lues
Vérification des faits avec la nouvelle API Grounding dans Jina Reader
Avec le nouveau g.jina.ai, vous pouvez facilement ancrer les déclarations pour réduire les hallucinations des LLM ou améliorer l'intégrité du contenu rédigé par les humains.
septembre 27, 2024 • 15 minutes lues
Migration des embeddings Jina v2 vers v3
Nous avons rassemblé quelques conseils pour vous aider à migrer de Jina Embeddings v2 vers v3.
septembre 18, 2024 • 10 minutes lues
Jina Embeddings v3 : Un modèle d'embedding multilingue à la pointe
jina-embeddings-v3 est un modèle d'embedding de texte multilingue de pointe avec 570M paramètres et une longueur de token de 8192, surpassant les derniers embeddings propriétaires d'OpenAI et Cohere sur MTEB.