Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Embeddings
Licence Apache 2.0
open_in_new Article de lancement

jina-embeddings-v2-base-de

Embeddings bilingues allemand-anglais avec performances SOTA
Licence
Apache-2.0
Date de sortie
calendar_month
2024-01-15
Saisie
abc
Texte
arrow_forward
Sortir
more_horiz
Vecteur
Chunking tardif help_outline
check_circle
Yes
Détails du modèle
Paramètres: 161M
Longueur du token d'entrée: 8K
Dimension de sortie: 768
Modèle de base help_outline
jina-bert-v2-base-de
Langues enseignées help_outline
2 langues
Modèles associés
link
jina-embeddings-v2-base-en
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S

Texte

jina-embeddings-v2-base-de

Vecteur

Frontière de Paretohelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Paramètres (log)nDCG@10
Ce modèle
Sur la frontière
Jina AI
Autres
MTEB English · retrieval
44.10
Paramètres
161M
Rang par score
27 / 39
Frontière de Pareto
Derrière
Distribution des valeurshelp_outline
AUC 0.8452
Corpus
Paires de traduction
Recherche documentaire
0.6900.000.200.400.600.80
Liées16.8%
Négatif difficile1.7%
Non liées0.9%
Seuils recommandés
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
équilibré · 0.368
AUC
0.8452
Plafond de bruit
0.793
Décrochage du rappel
0.195
Paires mesurées
119 / 11k
Composantes des vecteurshelp_outline
-0.19-0.010.17
σ 0.0361 · 183k valeurs
Géométrie des embeddingshelp_outline
0768
Moyenne par dimension, survolez pour la plage
Plancher de bruit
0.316
Dim. effectives
49 / 768
Paires de langueshelp_outline
de-ruen-deen-koen-zhja-ko
Écart du seuil entre les paires : 0.158
Choisissez les modèles à comparer
Publications (1)
arXiv
février 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Aperçu

jina-embeddings-v2-base-de est un modèle d'embedding de texte bilingue de 161M paramètres couvrant l'allemand et l'anglais, avec une fenêtre de contexte de 8 192 tokens. Il mappe le contenu sémantiquement équivalent dans les deux langues vers le même espace d'embedding de 768 dimensions, permettant la recherche interlingue sans traduction. Le modèle fut l'un des premiers modèles d'embedding bilingues open source à combiner le support du long contexte avec des performances équilibrées dans les deux langues.

Méthodes

Construit sur un backbone basé sur BERT avec des encodings positionnels ALiBi bidirectionnels symétriques, le modèle traite à la fois l'allemand et l'anglais à travers une architecture unifiée de 161M paramètres produisant des embeddings de 768 dimensions. L'entraînement a compris trois étapes : (1) pré-entraînement multilingue sur des corpus parallèles allemand-anglais, (2) ajustement fin contrastif sur des paires de phrases curées avec des négatifs difficiles, et (3) entraînement d'alignement interlingue pour garantir que les textes sémantiquement équivalents en allemand et en anglais mappent vers des régions voisines de l'espace d'embedding. Un choix de conception clé fut l'objectif de minimisation de biais, qui contrebalance la tendance des modèles multilingues à favoriser les structures grammaticales anglaises — un mode d'échec documenté des embeddings multilingues antérieurs. La fenêtre de 8 192 tokens via ALiBi permet de traiter des documents entiers dans les deux langues sans troncature.

Performance

Le modèle a surpassé E5-base de Microsoft tout en étant moins d'un tiers de sa taille, et a égalé les performances d'E5-large malgré une taille 7 fois plus petite. Sur WikiCLIR (recherche anglais vers allemand), STS17/STS22 (similarité sémantique bidirectionnelle) et BUCC (alignement de texte bilingue), il a constamment surpassé des modèles de taille comparable ou supérieure. L'empreinte de 322Mo a permis son déploiement sur un matériel standard. En 2026, jina-embeddings-v5-text-small remplace ce modèle pour la plupart des applications, offrant un contexte de 32K, 89 langues et des adaptateurs LoRA spécifiques aux tâches. Le modèle v2-base-de reste utile pour les pipelines bilingues allemand-anglais où le contexte de 8K est suffisant.

Conseils

Optimal pour la recherche bilingue allemand-anglais : recherche de produits, documentation d'assistance et gestion de contenu où les requêtes et les documents peuvent être dans des langues différentes. Pour les documents dépassant 8 192 tokens, utilisez le découpage sémantique ou le paramètre `late_chunking via l'API Jina. Le modèle s'intègre avec Qdrant, Weaviate, MongoDB et Milvus. Pour les nouveaux projets multilingues couvrant plus de deux langues, préférez jina-embeddings-v5-text-small` (89 langues, contexte de 32K, adaptateurs LoRA). Une GPU compatible CUDA est recommandée pour le débit en production.

Blogs qui mentionnent ce modèle
septembre 27, 2024 • 15 minutes lues
Migration From Jina Embeddings v2 to v3
We collected some tips to help you migrate from Jina Embeddings v2 to v3.
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
mai 15, 2024 • 11 minutes lues
Binary Embeddings: All the AI, 3.125% of the Fat
32-bits is a lot of precision for something as robust and inexact as an AI model. So we got rid of 31 of them! Binary embeddings are smaller, faster and highly performant.
Sofia Vasileva
Scott Martens
Futuristic digital 3D model of a coffee grinder with blue neon lights on a black background, featuring numerical data.
avril 29, 2024 • 7 minutes lues
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
janvier 31, 2024 • 16 minutes lues
A Deep Dive into Tokenization
Tokenization, in LLMs, means chopping input texts up into smaller parts for processing. So why are embeddings billed by the token?
Scott Martens
Colorful speckled grid pattern with a mix of small multicolored dots on a black background, creating a mosaic effect.
janvier 26, 2024 • 13 minutes lues
Jina Embeddings v2 Bilingual Models Are Now Open-Source On Hugging Face
Jina AI's open-source bilingual embedding models for German-English and Chinese-English are now on Hugging Face. We’re going to walk through installation and cross-language retrieval.
Scott Martens
Colorful "EMBEDDINGS" text above a pile of yellow smileys on a black background with decorative lines at the top.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.