Grafico I/O

Testo

jina-embeddings-v2-base-de

Vettore

Frontiera di Pareto
30M100M300M1B3.0B657075808590bge-m3EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parametri (log)Spearman
Questo modello
Sulla frontiera
Jina AI
Altri
MTEB English · sts
82.00
Parametri
161M
Classifica per punteggio
13 / 39
Frontiera di Pareto
Dietro
Distribuzione dei valori
AUC 0.8452
Corpus
Coppie di traduzione
Ricerca documentale
0.6900.000.200.400.600.80
Correlate16.8%
Negativo difficile1.7%
Non correlate0.9%
Soglie consigliate
FPR 0.1 · 0.499
FPR 0.01 · 0.690
FPR 0.001 · 0.796
FPR 0.0001 · 0.897
bilanciata · 0.368
AUC
0.8452
Soglia del rumore
0.793
Crollo del richiamo
0.195
Coppie misurate
119 / 11k
Componenti del vettore
-0.19-0.010.17
σ 0.0361 · 183k valori
Geometria dell'embedding
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.316
Dim. effettive
49 / 768
Coppie linguistiche
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.158
Scegli i modelli da confrontare
Pubblicazioni (1)

Panoramica

jina-embeddings-v2-base-de è un modello di embedding del testo bilingue da 161M parametri che copre tedesco e inglese, con una finestra di contesto di 8.192 token. Mappa i contenuti semanticamente equivalenti in entrambe le lingue nello stesso spazio di embedding a 768 dimensioni, abilitando la retrieval cross-linguistico senza traduzione. Il modello è stato uno dei primi modelli di embedding bilingue open source a combinare il supporto al lungo contesto con prestazioni bilanciate in entrambe le lingue.

Metodi

Costruito su un backbone basato su BERT con codifiche posizionali ALiBi bidirezionali simmetriche, il modello elabora sia tedesco che inglese attraverso un'architettura unificata da 161M parametri che produce embedding a 768 dimensioni. L'addestramento ha compreso tre stadi: (1) pre-addestramento multilingua su corpora paralleli tedesco-inglese, (2) fine-tuning contrastivo su coppie di frasi curate con negativi difficili, e (3) addestramento di allineamento cross-linguistico per assicurare che i testi semanticamente equivalenti in tedesco e inglese mappino su regioni vicine dello spazio di embedding. Una scelta di progettazione chiave fu l'obiettivo di minimizzazione del bias, che contrasta la tendenza dei modelli multilingua a favorire le strutture grammaticali inglesi — un noto modo di fallimento degli embedding multilingua precedenti. La finestra di 8.192 token via ALiBi permette l'elaborazione di documenti interi in entrambe le lingue senza troncatura.

Prestazione

Il modello ha superato E5-base di Microsoft essendo meno di un terzo della sua dimensione, e ha eguagliato le prestazioni di E5-large nonostante fosse 7 volte più piccolo. Su WikiCLIR (retrieval inglese-tedesco), STS17/STS22 (similarità semantica bidirezionale) e BUCC (allineamento di testo bilingue), ha costantemente superato modelli di dimensione comparabile o maggiore. Il footprint di 322MB ne ha permesso il deployment su hardware standard. Nel 2026, jina-embeddings-v5-text-small rimpiazza questo modello per la maggior parte delle applicazioni, offrendo contesto di 32K, 89 lingue e adattatori LoRA specifici per il task. Il modello v2-base-de resta utile per pipeline bilingue tedesco-inglese in cui il contesto di 8K è sufficiente.

Orientamento

Ottimale per la retrieval bilingue tedesco-inglese: ricerca di prodotti, documentazione di supporto e gestione dei contenuti dove query e documenti possono essere in lingue diverse. Per documenti che superano 8.192 token, usa il chunking semantico o il parametro `late_chunking tramite l'API di Jina. Il modello si integra con Qdrant, Weaviate, MongoDB e Milvus. Per nuovi progetti multilingua che coprono più di due lingue, preferisci jina-embeddings-v5-text-small` (89 lingue, contesto di 32K, adattatori LoRA). GPU con supporto CUDA consigliata per il throughput di produzione.

Blog che menzionano questo modello