Aperçu
jina-embeddings-v2-base-en est un modèle d'embedding de texte anglais de 137M paramètres avec une fenêtre de contexte de 8 192 tokens — 16 fois la limite standard de 512 tokens de son époque. Construit sur un backbone BERT-small avec ALiBi bidirectionnelle symétrique (Attention with Linear Biases), c'était le premier embedding Jina open source à traiter nativement des documents longs sans troncature ni découpage. Il produit des vecteurs de 768 dimensions et reste un choix solide pour la recherche uniquement en anglais lorsque les fonctions multilingues ou de long contexte de v3/v5 ne sont pas nécessaires.
Méthodes
L'architecture associe un transformeur BERT-small (12 couches, 12 têtes d'attention, 768 dimensions cachées) à des encodings positionnels ALiBi bidirectionnels symétriques. ALiBi remplace les embeddings positionnels appris par un biais d'attention décroissant linéairement, permettant au modèle d'extrapoler bien au-delà de sa longueur d'entraînement de 512 tokens jusqu'à 8 192 tokens sans dégradation des performances. L'entraînement a suivi un pipeline en deux étapes : pré-entraînement sur C4, puis ajustement fin sur la collection curée de Jina de 40+ jeux de données de paires de phrases spécialisées, avec minage de négatifs difficiles. L'attention bidirectionnelle symétrique garantit que chaque token prête attention à la fois au contexte précédent et suivant, produisant des représentations capturant le sens global de la phrase. Le pooling moyen sur toutes les représentations de tokens produit l'embedding final de 768 dimensions.
Performance
Au moment de sa publication, le modèle a surpassé text-embedding-ada-002 d'OpenAI sur plusieurs sous-tâches MTEB en anglais : classification (73,45 % vs 70,93 %), réordonnancement (85,38 % vs 84,89 %), recherche (56,98 % vs 56,32 %) et résumé (31,6 % vs 30,8 %). Son contexte de 8 192 tokens fut un avantage considérable face aux modèles concurrents limités à 512–2 048 tokens, permettant la recherche au niveau document sans découpage. L'empreinte compacte de 307Mo le rendit déployable sur des GPU de grand public. En 2026, jina-embeddings-v5-text-small (677M paramètres, contexte de 32K, adaptateurs LoRA spécifiques aux tâches) le surpasse pour la plupart des charges de travail de production, mais il reste pertinent pour les pipelines légers uniquement en anglais.
Conseils
Utilisez ce modèle pour la recherche uniquement en anglais lorsque la fenêtre de contexte de 8K est suffisante et que des adaptateurs multilingues ou spécifiques aux tâches ne sont pas requis. Pour les documents dépassant 8 192 tokens, appliquez le découpage sémantique avant l'embedding. Le modèle s'intègre avec les principales bases de données vectorielles (Qdrant, Weaviate, MongoDB Atlas, Milvus) et les frameworks RAG (LangChain, LlamaIndex, Haystack). Pour les nouveaux projets nécessitant un support multilingue, un contexte de 32K ou une optimisation spécifique aux tâches, préférez jina-embeddings-v5-text-small. Une GPU compatible CUDA est recommandée pour le débit en production ; l'inférence CPU est possible mais nettement plus lente.










