Berlino, Germania - 15 gennaio 2023 – Riecheggiando l'iconico 'Ich bin ein Berliner' di JFK, noi di Jina AI siamo entusiasti di collegare le lingue a modo nostro. Oggi siamo orgogliosi di annunciare la nostra ultima innovazione: jina-embeddings-v2-base-de, un modello di embedding tedesco/inglese. Questo modello bilingue all'avanguardia rappresenta un importante passo avanti nella rappresentazione del linguaggio, con una lunghezza di contesto di 8.192 token. Ciò che lo distingue è la sua notevole efficienza: raggiunge prestazioni di alto livello pur essendo solo 1/7 delle dimensioni dei modelli comparabili.
Gli embedding sono cruciali per le aziende tedesche che cercano di espandersi nel mercato statunitense. Secondo il German American Business Outlook (GABO) 2022, circa un terzo delle aziende tedesche genera oltre il 20% delle vendite e dei profitti globali negli Stati Uniti, con il 93% che prevede un aumento delle vendite statunitensi. Questa tendenza continua mentre il 93% prevede di aumentare gli investimenti della propria azienda negli Stati Uniti nei prossimi tre anni, con l'85% che prevede una crescita delle vendite nette e un significativo focus sulla trasformazione digitale. Gli embedding di qualità possono svolgere un ruolo fondamentale in questa espansione facilitando una migliore comprensione delle preferenze dei clienti, consentendo una comunicazione più efficace e posizionando prodotti culturalmente risonanti.
La nostra innovazione è particolarmente vantaggiosa per le aziende tedesche che cercano di implementare applicazioni bilingui nei paesi di lingua inglese. Con jina-embeddings-v2-base-de, siamo entusiasti di vedere come le aziende tedesche innoveranno e prospereranno in un mondo sempre più connesso.
tagPunti Salienti del Modello
- Prestazioni all'Avanguardia: jina-embeddings-v2-base-de si classifica costantemente ai vertici nei benchmark rilevanti e guida tra i modelli open-source di dimensioni simili.
- Modello Bilingue: Questo modello codifica testi sia in tedesco che in inglese, consentendo l'uso di entrambe le lingue come query o documento target nelle applicazioni di recupero. I testi con significati equivalenti in entrambe le lingue vengono mappati nello stesso spazio di embedding, formando la base per applicazioni multilingue.
- Contesto Esteso: Una lunghezza di 8192 token permette a jina-embeddings-v2-base-de di supportare testi più lunghi e frammenti di documenti, superando di gran lunga i modelli che supportano solo poche centinaia di token alla volta.
- Dimensioni Compatte: jina-embeddings-v2-base-de è costruito per alte prestazioni su hardware standard. Con soli 161 milioni di parametri, l'intero modello è di 322MB e si adatta alla memoria dei computer comuni. Gli embedding stessi sono di 768 dimensioni, una dimensione vettoriale relativamente piccola rispetto a molti modelli, risparmiando spazio e tempo di esecuzione per le applicazioni.
- Minimizzazione dei Bias: Ricerche recenti mostrano che i modelli multilingue senza specifico addestramento linguistico mostrano forti bias verso le strutture grammaticali inglesi negli embedding. I modelli di embedding dovrebbero riguardare la cattura del significato e non favorire coppie di frasi che sono meramente simili superficialmente.
- Integrazione Senza Soluzione di Continuità: I modelli Jina Embeddings v2 hanno integrazioni native con i principali database vettoriali, inclusi MongoDB, Qdrant, e Weaviate, così come framework RAG e LLM come Haystack e LlamaIndex.
tagPerformance Leader nel NLP Tedesco
Abbiamo messo alla prova jina-embeddings-v2-base-de contro quattro rinomati baseline che supportano anche tedesco e inglese. Questi includono:
- Multilingual-E5-large e Multilingual-E5-base di Microsoft
- Il Cross English & German RoBERTa for Sentence Embeddings di T-Systems
- Sentence-BERT (
distiluse-base-multilingual-cased-v2)
I nostri benchmark includono i task MTEB per l'inglese e il nostro benchmark personalizzato. Data la mancanza di una suite di benchmark completa per gli embedding tedeschi, abbiamo preso l'iniziativa di sviluppare la nostra, ispirata al MTEB. Siamo orgogliosi di condividere qui i nostri risultati e progressi.

tagDimensioni Compatte, Risultati Superiori
jina-embeddings-v2-base-de dimostra prestazioni eccezionali, specialmente nei compiti in lingua tedesca. Supera il modello E5 base pur essendo meno di un terzo delle sue dimensioni. Inoltre, si confronta alla pari con il modello E5 large, che è sette volte più grande, dimostrando la sua efficienza e potenza. Questa efficienza rende jina-embeddings-v2-base-de rivoluzionario, particolarmente se confrontato con altri popolari modelli di embedding bi- e multilingue.
tagEccellenza nel Recupero Cross-Linguistico Tedesco-Inglese
Il nostro modello non riguarda solo dimensioni ed efficienza; è anche un top performer nei compiti di recupero cross-linguistico inglese-tedesco. Questo è evidente nelle sue prestazioni in vari benchmark chiave:
- WikiCLIR, per il recupero da inglese a tedesco
- STS17, parte della valutazione MTEB per il recupero da inglese a tedesco
- STS22, per il recupero da tedesco a inglese, anche parte di MTEB
- BUCC, per il recupero da tedesco a inglese, incluso in MTEB
Le prestazioni in questi benchmark, particolarmente nei test di valutazione MTEB (con l'eccezione di WikiCLIR), sottolineano l'efficacia di jina-embeddings-v2-base-de nel gestire compiti bilingue complessi.

tagOttieni Accesso API
Le nostre offerte per i nostri utenti enterprise che valorizzano la privacy e la conformità dei dati, incluso jina-embeddings-v2-base-de, sono accessibili tramite la Jina Embeddings API:
- Visita Jina Embeddings API e clicca sul menu a tendina dei modelli
- Seleziona jina-embeddings-v2-base-de


Renderemo questo modello disponibile molto presto nel marketplace di AWS Sagemaker per gli utenti Amazon cloud e per il download su HuggingFace.
tagJina 8K Embeddings: La pietra angolare di diverse applicazioni AI
Gli embedding sono cruciali per un'ampia gamma di applicazioni AI, tra cui il recupero delle informazioni, il controllo della qualità dei dati, la classificazione e i sistemi di raccomandazione. Sono fondamentali per migliorare numerosi compiti di AI.
Jina AI si impegna a far progredire lo stato dell'arte nella tecnologia degli embedding, mantenendo i nostri componenti AI core trasparenti, accessibili ed economici per le imprese di tutti i tipi e dimensioni che valorizzano la privacy e la conformità dei dati. Oltre a jina-embeddings-v2-base-de, Jina AI ha rilasciato modelli di embedding all'avanguardia per il cinese e modelli monolingue ad alte prestazioni per l'inglese. Questo fa parte della nostra missione di rendere la tecnologia AI più inclusiva e globalmente applicabile.
Apprezziamo il vostro feedback. Unitevi al nostro canale community per contribuire con feedback e rimanere informati sui nostri progressi. Insieme, stiamo plasmando un futuro dell'AI più robusto e inclusivo.







