Graphique d'E/S

Texte

jina-embeddings-v2-base-de

Vecteur

Frontière de Pareto
30M100M300M1B3.0B657075808590bge-m3EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Paramètres (log)Spearman
Ce modèle
Sur la frontière
Jina AI
Autres
MTEB English · sts
82.00
Paramètres
161M
Rang par score
13 / 39
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.8452
Corpus
Paires de traduction
Recherche documentaire
0.6900.000.200.400.600.80
Liées16.8%
Négatif difficile1.7%
Non liées0.9%
Seuils recommandés
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
équilibré · 0.368
AUC
0.8452
Plafond de bruit
0.793
Décrochage du rappel
0.195
Paires mesurées
119 / 11k
Composantes des vecteurs
-0.19-0.010.17
σ 0.0361 · 183k valeurs
Géométrie des embeddings
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.316
Dim. effectives
49 / 768
Paires de langues
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.158
Choisissez les modèles à comparer
Publications (1)

Aperçu

jina-embeddings-v2-base-de est un modèle d'embedding de texte bilingue de 161M paramètres couvrant l'allemand et l'anglais, avec une fenêtre de contexte de 8 192 tokens. Il mappe le contenu sémantiquement équivalent dans les deux langues vers le même espace d'embedding de 768 dimensions, permettant la recherche interlingue sans traduction. Le modèle fut l'un des premiers modèles d'embedding bilingues open source à combiner le support du long contexte avec des performances équilibrées dans les deux langues.

Méthodes

Construit sur un backbone basé sur BERT avec des encodings positionnels ALiBi bidirectionnels symétriques, le modèle traite à la fois l'allemand et l'anglais à travers une architecture unifiée de 161M paramètres produisant des embeddings de 768 dimensions. L'entraînement a compris trois étapes : (1) pré-entraînement multilingue sur des corpus parallèles allemand-anglais, (2) ajustement fin contrastif sur des paires de phrases curées avec des négatifs difficiles, et (3) entraînement d'alignement interlingue pour garantir que les textes sémantiquement équivalents en allemand et en anglais mappent vers des régions voisines de l'espace d'embedding. Un choix de conception clé fut l'objectif de minimisation de biais, qui contrebalance la tendance des modèles multilingues à favoriser les structures grammaticales anglaises — un mode d'échec documenté des embeddings multilingues antérieurs. La fenêtre de 8 192 tokens via ALiBi permet de traiter des documents entiers dans les deux langues sans troncature.

Performance

Le modèle a surpassé E5-base de Microsoft tout en étant moins d'un tiers de sa taille, et a égalé les performances d'E5-large malgré une taille 7 fois plus petite. Sur WikiCLIR (recherche anglais vers allemand), STS17/STS22 (similarité sémantique bidirectionnelle) et BUCC (alignement de texte bilingue), il a constamment surpassé des modèles de taille comparable ou supérieure. L'empreinte de 322Mo a permis son déploiement sur un matériel standard. En 2026, jina-embeddings-v5-text-small remplace ce modèle pour la plupart des applications, offrant un contexte de 32K, 89 langues et des adaptateurs LoRA spécifiques aux tâches. Le modèle v2-base-de reste utile pour les pipelines bilingues allemand-anglais où le contexte de 8K est suffisant.

Conseils

Optimal pour la recherche bilingue allemand-anglais : recherche de produits, documentation d'assistance et gestion de contenu où les requêtes et les documents peuvent être dans des langues différentes. Pour les documents dépassant 8 192 tokens, utilisez le découpage sémantique ou le paramètre `late_chunking via l'API Jina. Le modèle s'intègre avec Qdrant, Weaviate, MongoDB et Milvus. Pour les nouveaux projets multilingues couvrant plus de deux langues, préférez jina-embeddings-v5-text-small` (89 langues, contexte de 32K, adaptateurs LoRA). Une GPU compatible CUDA est recommandée pour le débit en production.

Blogs qui mentionnent ce modèle