Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Punti Salienti del Modello
Performance Leader nel NLP Tedesco
Ottieni Accesso API
Jina 8K Embeddings: La pietra angolare di diverse applicazioni AI
comunicato stampa
gennaio 15, 2024

Ich bin ein Berliner: Embedding bilingue tedesco-inglese con lunghezza del token di 8K

Jina AI introduce un modello di embedding bilingue tedesco/inglese, con un'estesa lunghezza di 8.192 token, progettato specificamente per supportare le aziende tedesche che operano nel mercato statunitense.
Illustration of Berlin's Brandenburg Gate in neon-style green and blue with classical design elements and a chariot sculpture
Jina AI • 5 minuti letti

Berlino, Germania - 15 gennaio 2023 – Riecheggiando l'iconico 'Ich bin ein Berliner' di JFK, noi di Jina AI siamo entusiasti di collegare le lingue a modo nostro. Oggi siamo orgogliosi di annunciare la nostra ultima innovazione: jina-embeddings-v2-base-de, un modello di embedding tedesco/inglese. Questo modello bilingue all'avanguardia rappresenta un importante passo avanti nella rappresentazione del linguaggio, con una lunghezza di contesto di 8.192 token. Ciò che lo distingue è la sua notevole efficienza: raggiunge prestazioni di alto livello pur essendo solo 1/7 delle dimensioni dei modelli comparabili.

Gli embedding sono cruciali per le aziende tedesche che cercano di espandersi nel mercato statunitense. Secondo il German American Business Outlook (GABO) 2022, circa un terzo delle aziende tedesche genera oltre il 20% delle vendite e dei profitti globali negli Stati Uniti, con il 93% che prevede un aumento delle vendite statunitensi. Questa tendenza continua mentre il 93% prevede di aumentare gli investimenti della propria azienda negli Stati Uniti nei prossimi tre anni, con l'85% che prevede una crescita delle vendite nette e un significativo focus sulla trasformazione digitale. Gli embedding di qualità possono svolgere un ruolo fondamentale in questa espansione facilitando una migliore comprensione delle preferenze dei clienti, consentendo una comunicazione più efficace e posizionando prodotti culturalmente risonanti.

La nostra innovazione è particolarmente vantaggiosa per le aziende tedesche che cercano di implementare applicazioni bilingui nei paesi di lingua inglese. Con jina-embeddings-v2-base-de, siamo entusiasti di vedere come le aziende tedesche innoveranno e prospereranno in un mondo sempre più connesso.

tagPunti Salienti del Modello

  • Prestazioni all'Avanguardia: jina-embeddings-v2-base-de si classifica costantemente ai vertici nei benchmark rilevanti e guida tra i modelli open-source di dimensioni simili.
  • Modello Bilingue: Questo modello codifica testi sia in tedesco che in inglese, consentendo l'uso di entrambe le lingue come query o documento target nelle applicazioni di recupero. I testi con significati equivalenti in entrambe le lingue vengono mappati nello stesso spazio di embedding, formando la base per applicazioni multilingue.
  • Contesto Esteso: Una lunghezza di 8192 token permette a jina-embeddings-v2-base-de di supportare testi più lunghi e frammenti di documenti, superando di gran lunga i modelli che supportano solo poche centinaia di token alla volta.
  • Dimensioni Compatte: jina-embeddings-v2-base-de è costruito per alte prestazioni su hardware standard. Con soli 161 milioni di parametri, l'intero modello è di 322MB e si adatta alla memoria dei computer comuni. Gli embedding stessi sono di 768 dimensioni, una dimensione vettoriale relativamente piccola rispetto a molti modelli, risparmiando spazio e tempo di esecuzione per le applicazioni.
  • Minimizzazione dei Bias: Ricerche recenti mostrano che i modelli multilingue senza specifico addestramento linguistico mostrano forti bias verso le strutture grammaticali inglesi negli embedding. I modelli di embedding dovrebbero riguardare la cattura del significato e non favorire coppie di frasi che sono meramente simili superficialmente.
  • Integrazione Senza Soluzione di Continuità: I modelli Jina Embeddings v2 hanno integrazioni native con i principali database vettoriali, inclusi MongoDB, Qdrant, e Weaviate, così come framework RAG e LLM come Haystack e LlamaIndex.

tagPerformance Leader nel NLP Tedesco

Abbiamo messo alla prova jina-embeddings-v2-base-de contro quattro rinomati baseline che supportano anche tedesco e inglese. Questi includono:

  • Multilingual-E5-large e Multilingual-E5-base di Microsoft
  • Il Cross English & German RoBERTa for Sentence Embeddings di T-Systems
  • Sentence-BERT (distiluse-base-multilingual-cased-v2)

I nostri benchmark includono i task MTEB per l'inglese e il nostro benchmark personalizzato. Data la mancanza di una suite di benchmark completa per gli embedding tedeschi, abbiamo preso l'iniziativa di sviluppare la nostra, ispirata al MTEB. Siamo orgogliosi di condividere qui i nostri risultati e progressi.

GitHub - jina-ai/mteb-de: MTEB: Massive Text Embedding Benchmark
MTEB: Massive Text Embedding Benchmark. Contribute to jina-ai/mteb-de development by creating an account on GitHub.
GitHubjina-ai
Una tabella che confronta le prestazioni dei modelli di machine learning con quattro modelli distinti elencati per nome, dimensione in MB e competenza in compiti tedeschi e inglesi

tagDimensioni Compatte, Risultati Superiori

jina-embeddings-v2-base-de dimostra prestazioni eccezionali, specialmente nei compiti in lingua tedesca. Supera il modello E5 base pur essendo meno di un terzo delle sue dimensioni. Inoltre, si confronta alla pari con il modello E5 large, che è sette volte più grande, dimostrando la sua efficienza e potenza. Questa efficienza rende jina-embeddings-v2-base-de rivoluzionario, particolarmente se confrontato con altri popolari modelli di embedding bi- e multilingue.

tagEccellenza nel Recupero Cross-Linguistico Tedesco-Inglese

Il nostro modello non riguarda solo dimensioni ed efficienza; è anche un top performer nei compiti di recupero cross-linguistico inglese-tedesco. Questo è evidente nelle sue prestazioni in vari benchmark chiave:

  • WikiCLIR, per il recupero da inglese a tedesco
  • STS17, parte della valutazione MTEB per il recupero da inglese a tedesco
  • STS22, per il recupero da tedesco a inglese, anche parte di MTEB
  • BUCC, per il recupero da tedesco a inglese, incluso in MTEB

Le prestazioni in questi benchmark, particolarmente nei test di valutazione MTEB (con l'eccezione di WikiCLIR), sottolineano l'efficacia di jina-embeddings-v2-base-de nel gestire compiti bilingue complessi.

Tabella di confronto dei modelli linguistici con dimensioni in MB e percentuali di accuratezza per metriche come WikiCLIR e STS17

tagOttieni Accesso API

Le nostre offerte per i nostri utenti enterprise che valorizzano la privacy e la conformità dei dati, incluso jina-embeddings-v2-base-de, sono accessibili tramite la Jina Embeddings API:

  1. Visita Jina Embeddings API e clicca sul menu a tendina dei modelli
  2. Seleziona jina-embeddings-v2-base-de
Embedding API
Performance di alto livello, lunghezza del contesto di 8192 token, $100 per 1.25B token, alternativa perfetta a OpenAI, prova gratuita
Screenshot della piattaforma tecnologica con modelli linguistici evidenziati, snippet di codice e opzioni come 'Integrate' e 'Try out'

Renderemo questo modello disponibile molto presto nel marketplace di AWS Sagemaker per gli utenti Amazon cloud e per il download su HuggingFace.

tagJina 8K Embeddings: La pietra angolare di diverse applicazioni AI

Gli embedding sono cruciali per un'ampia gamma di applicazioni AI, tra cui il recupero delle informazioni, il controllo della qualità dei dati, la classificazione e i sistemi di raccomandazione. Sono fondamentali per migliorare numerosi compiti di AI.

Jina AI si impegna a far progredire lo stato dell'arte nella tecnologia degli embedding, mantenendo i nostri componenti AI core trasparenti, accessibili ed economici per le imprese di tutti i tipi e dimensioni che valorizzano la privacy e la conformità dei dati. Oltre a jina-embeddings-v2-base-de, Jina AI ha rilasciato modelli di embedding all'avanguardia per il cinese e modelli monolingue ad alte prestazioni per l'inglese. Questo fa parte della nostra missione di rendere la tecnologia AI più inclusiva e globalmente applicabile.

Apprezziamo il vostro feedback. Unitevi al nostro canale community per contribuire con feedback e rimanere informati sui nostri progressi. Insieme, stiamo plasmando un futuro dell'AI più robusto e inclusivo.

Unisciti al Server Discord di Jina AI!
Scopri la community Jina AI su Discord - confrontati con altri 4232 membri e goditi chat vocali e testuali gratuite.
Discord
Categorie:
comunicato stampa
rss_feed

Per saperne di più
agosto 03, 2026 • 11 minuti letti
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
maggio 12, 2026 • 7 minuti letti
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
febbraio 19, 2026 • 7 minuti letti
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.