Aperçu
jina-embeddings-v2-base-de est un modèle d'embedding de texte bilingue de 161M paramètres couvrant l'allemand et l'anglais, avec une fenêtre de contexte de 8 192 tokens. Il mappe le contenu sémantiquement équivalent dans les deux langues vers le même espace d'embedding de 768 dimensions, permettant la recherche interlingue sans traduction. Le modèle fut l'un des premiers modèles d'embedding bilingues open source à combiner le support du long contexte avec des performances équilibrées dans les deux langues.
Méthodes
Construit sur un backbone basé sur BERT avec des encodings positionnels ALiBi bidirectionnels symétriques, le modèle traite à la fois l'allemand et l'anglais à travers une architecture unifiée de 161M paramètres produisant des embeddings de 768 dimensions. L'entraînement a compris trois étapes : (1) pré-entraînement multilingue sur des corpus parallèles allemand-anglais, (2) ajustement fin contrastif sur des paires de phrases curées avec des négatifs difficiles, et (3) entraînement d'alignement interlingue pour garantir que les textes sémantiquement équivalents en allemand et en anglais mappent vers des régions voisines de l'espace d'embedding. Un choix de conception clé fut l'objectif de minimisation de biais, qui contrebalance la tendance des modèles multilingues à favoriser les structures grammaticales anglaises — un mode d'échec documenté des embeddings multilingues antérieurs. La fenêtre de 8 192 tokens via ALiBi permet de traiter des documents entiers dans les deux langues sans troncature.
Performance
Le modèle a surpassé E5-base de Microsoft tout en étant moins d'un tiers de sa taille, et a égalé les performances d'E5-large malgré une taille 7 fois plus petite. Sur WikiCLIR (recherche anglais vers allemand), STS17/STS22 (similarité sémantique bidirectionnelle) et BUCC (alignement de texte bilingue), il a constamment surpassé des modèles de taille comparable ou supérieure. L'empreinte de 322Mo a permis son déploiement sur un matériel standard. En 2026, jina-embeddings-v5-text-small remplace ce modèle pour la plupart des applications, offrant un contexte de 32K, 89 langues et des adaptateurs LoRA spécifiques aux tâches. Le modèle v2-base-de reste utile pour les pipelines bilingues allemand-anglais où le contexte de 8K est suffisant.
Conseils
Optimal pour la recherche bilingue allemand-anglais : recherche de produits, documentation d'assistance et gestion de contenu où les requêtes et les documents peuvent être dans des langues différentes. Pour les documents dépassant 8 192 tokens, utilisez le découpage sémantique ou le paramètre `late_chunking via l'API Jina. Le modèle s'intègre avec Qdrant, Weaviate, MongoDB et Milvus. Pour les nouveaux projets multilingues couvrant plus de deux langues, préférez jina-embeddings-v5-text-small` (89 langues, contexte de 32K, adaptateurs LoRA). Une GPU compatible CUDA est recommandée pour le débit en production.









