Panoramica
jina-embeddings-v2-base-de è un modello di embedding del testo bilingue da 161M parametri che copre tedesco e inglese, con una finestra di contesto di 8.192 token. Mappa i contenuti semanticamente equivalenti in entrambe le lingue nello stesso spazio di embedding a 768 dimensioni, abilitando la retrieval cross-linguistico senza traduzione. Il modello è stato uno dei primi modelli di embedding bilingue open source a combinare il supporto al lungo contesto con prestazioni bilanciate in entrambe le lingue.
Metodi
Costruito su un backbone basato su BERT con codifiche posizionali ALiBi bidirezionali simmetriche, il modello elabora sia tedesco che inglese attraverso un'architettura unificata da 161M parametri che produce embedding a 768 dimensioni. L'addestramento ha compreso tre stadi: (1) pre-addestramento multilingua su corpora paralleli tedesco-inglese, (2) fine-tuning contrastivo su coppie di frasi curate con negativi difficili, e (3) addestramento di allineamento cross-linguistico per assicurare che i testi semanticamente equivalenti in tedesco e inglese mappino su regioni vicine dello spazio di embedding. Una scelta di progettazione chiave fu l'obiettivo di minimizzazione del bias, che contrasta la tendenza dei modelli multilingua a favorire le strutture grammaticali inglesi — un noto modo di fallimento degli embedding multilingua precedenti. La finestra di 8.192 token via ALiBi permette l'elaborazione di documenti interi in entrambe le lingue senza troncatura.
Prestazione
Il modello ha superato E5-base di Microsoft essendo meno di un terzo della sua dimensione, e ha eguagliato le prestazioni di E5-large nonostante fosse 7 volte più piccolo. Su WikiCLIR (retrieval inglese-tedesco), STS17/STS22 (similarità semantica bidirezionale) e BUCC (allineamento di testo bilingue), ha costantemente superato modelli di dimensione comparabile o maggiore. Il footprint di 322MB ne ha permesso il deployment su hardware standard. Nel 2026, jina-embeddings-v5-text-small rimpiazza questo modello per la maggior parte delle applicazioni, offrendo contesto di 32K, 89 lingue e adattatori LoRA specifici per il task. Il modello v2-base-de resta utile per pipeline bilingue tedesco-inglese in cui il contesto di 8K è sufficiente.
Orientamento
Ottimale per la retrieval bilingue tedesco-inglese: ricerca di prodotti, documentazione di supporto e gestione dei contenuti dove query e documenti possono essere in lingue diverse. Per documenti che superano 8.192 token, usa il chunking semantico o il parametro `late_chunking tramite l'API di Jina. Il modello si integra con Qdrant, Weaviate, MongoDB e Milvus. Per nuovi progetti multilingua che coprono più di due lingue, preferisci jina-embeddings-v5-text-small` (89 lingue, contesto di 32K, adattatori LoRA). GPU con supporto CUDA consigliata per il throughput di produzione.









