In seguito al notevole successo dei precedenti Embeddings V2, siamo entusiasti di annunciare il lancio del nostro ultimo modello di embedding testuale bilingue cinese/inglese: jina-embeddings-v2-base-zh. Questo nuovo modello eredita l'eccezionale lunghezza di 8K token di Jina Embeddings V2, ora con un robusto supporto sia per il cinese che per l'inglese.
jina-embeddings-v2-base-zh si distingue per la sua qualità e prestazioni eccezionali, ottenute attraverso un rigoroso e bilanciato pre-training con dati bilingue di alta qualità. Questo approccio garantisce una significativa riduzione del bias, spesso presente nei modelli addestrati con dati multilingue non bilanciati.
tagPunti Salienti
- Modello Bilingue: Questo modello codifica testi sia in inglese che in cinese, permettendo l'uso di entrambe le lingue come query o documento target. I testi con significati equivalenti in queste lingue vengono mappati nello stesso spazio di embedding, formando la base per numerose applicazioni multilingue.
- Lunghezza Estesa di 8K Token: Il nostro modello è in grado di elaborare passaggi di testo significativamente ampi, una caratteristica che supera le capacità della maggior parte degli altri modelli open-source.
- Compatto ed Efficiente: Con una dimensione di 322MB (161 milioni di parametri) e dimensioni di output di 768, il nostro modello è progettato per alte prestazioni su hardware standard senza GPU, migliorandone l'accessibilità.
tagPerformance Leader su C-MTEB
Nella classifica Chinese MTEB, il nostro Jina Embeddings v2, che supporta sia il cinese che l'inglese, si distingue come uno dei migliori modelli sotto 0.5GB. Ciò che lo rende unico è la sua impressionante capacità di gestire 8K token, una caratteristica unica nella sua categoria.

Tra i modelli cinesi di dimensioni simili, solo il modello E5 Multilingual e il nostro jina-embeddings-v2-base-zh offrono supporto per l'inglese, consentendo efficaci applicazioni cross-language. In particolare, Jina dimostra prestazioni significativamente superiori in tutte le categorie che coinvolgono la lingua cinese.

Mentre entrambi i modelli hanno una dimensione di contesto di 8K token, jina-embeddings-v2-base-zh supera significativamente text-embedding-ada-002 di OpenAI, specialmente nei compiti che coinvolgono la lingua cinese.

tagPotenziare le Imprese Cinesi per l'Espansione Globale
Il nostro modello di embedding cinese-inglese è uno strumento potente per le aziende cinesi che cercano di "andare globali". Elabora senza problemi i testi cinesi, fornendo embedding di alta qualità che si integrano facilmente con i principali database vettoriali, sistemi di ricerca e applicazioni RAG.
jina-embeddings-v2-base-zh è particolarmente vantaggioso per lo sviluppo di applicazioni AI adattate ai contesti cinese-inglese, cruciali per le imprese in espansione internazionale. Ecco alcuni casi d'uso specifici:
- Analisi e Gestione Documenti: Può analizzare e gestire una vasta gamma di documenti, supportando transazioni legali e commerciali internazionali.
- Applicazioni di Ricerca basate su AI: Migliora le funzioni di ricerca in ambienti multilingue, facilitando agli utenti globali la ricerca di informazioni rilevanti in cinese e inglese.
- Chatbot con Recupero di Informazioni e Risposta a Domande: Costruisce bot di servizio clienti bilingui efficienti, migliorando le interazioni con i clienti in tutto il mondo.
- Applicazioni di Elaborazione del Linguaggio Naturale: Include analisi del sentimento per comprendere le tendenze del mercato globale, modellazione di argomenti per strategie di marketing internazionale e classificazione del testo per gestire la comunicazione globale.
- Sistemi di Raccomandazione: Personalizza raccomandazioni di prodotti e contenuti per diversi pubblici globali, utilizzando insight tratti da dati cinesi e inglesi.
Sfruttando questo modello, le imprese cinesi possono colmare efficacemente il divario linguistico nelle loro applicazioni AI, migliorando la loro competitività globale e la portata di mercato.
tagInizia con jina-embeddings-v2-base-zh via API
Inizia subito a integrare il nostro modello nel tuo flusso di lavoro attraverso l'API Embeddings. Visita semplicemente il nostro portale Embeddings, ottieni la tua chiave di accesso gratuita o ricarica una chiave esistente, quindi scegli jina-embeddings-v2-base-zh dal menu a tendina. È così facile iniziare!


tagProssimi Passi: Espansione del Supporto Linguistico e Integrazione AWS Sagemaker
jina-embeddings-v2-base-zh sarà presto disponibile tramite AWS Sagemaker e Hugging Face.


In Jina AI, il nostro impegno a essere leader nella tecnologia di embedding accessibile e conveniente per un pubblico globale è incrollabile. Stiamo attivamente sviluppando ulteriori offerte multilingue, concentrandoci sulle principali lingue europee e altre lingue internazionali, per ampliare la nostra portata. Restate sintonizzati per questi entusiasmanti aggiornamenti, inclusa l'integrazione con AWS SageMaker, mentre continuiamo a espandere le nostre capacità.
tagUn Ringraziamento Speciale ai Nostri Early Tester
Siamo immensamente grati ai membri selezionati della nostra comunità di utenti cinesi che hanno testato la versione preview (jina-embeddings-v2-base-zh-preview). Il loro feedback perspicace è stato cruciale per migliorare le prestazioni della versione ufficiale per questo rilascio. Se hai osservazioni o suggerimenti riguardo alla qualità dei nostri modelli, ti invitiamo calorosamente a unirti al nostro server Discord e condividere i tuoi pensieri con noi. Il tuo input è inestimabile nel nostro percorso di miglioramento continuo.

Migliore distribuzione dei punteggi rispetto a jina-embeddings-v2-base-zh-preview
jina-embeddings-v2-base-zh-preview soffriva di punteggi di similarità gonfiati, portando a alti punteggi di coseno anche per elementi non correlati. Questo era particolarmente evidente nei primi 5 risultati dello screenshot qui sotto. I punteggi di similarità erano costantemente alti e non riflettevano accuratamente la vera relazione tra gli elementi. Ad esempio, il confronto tra "安妮" e "蒸汽机" riceveva punteggi di similarità fuorvianti.
Nella release ufficiale, abbiamo perfezionato il modello per produrre punteggi di similarità più distinti e logici, garantendo una rappresentazione più accurata delle relazioni tra gli elementi. Per esempio, il nuovo sistema di punteggio presenta ora un intervallo più ampio, offrendo una visione più chiara della similarità relativa tra gli elementi.
Inoltre, Jina Embeddings si distingue ora come l'unico modello di embedding open-source che supporta 8192 token. Questa caratteristica evidenzia la sua capacità di elaborare un'ampia varietà di tipi di dati, dai documenti estesi alle frasi brevi, o persino singole parole/nomi come "安妮" vs "露娜".

tagNuovo modello bilingue cinese-inglese di embedding 8K, essenziale per l'espansione globale delle aziende!
Dopo il successo di Embeddings V2, oggi lanciamo il nostro nuovo modello di embedding testuale bilingue cinese-inglese: jina-embeddings-v2-base-zh. Questo modello non solo eredita tutti i vantaggi di V2, con la capacità di elaborare testi fino a 8000 token, ma gestisce anche perfettamente contenuti bilingui cinese-inglese, aprendo le porte alle applicazioni multilingue.
L'eccellente performance di jina-embeddings-v2-base-zh è dovuta al dataset bilingue di alta qualità e al nostro rigoroso ed equilibrato processo di pre-training, fine-tuning primario e fine-tuning secondario. Questo approccio in tre fasi non solo ha generalizzato le capacità bilingui del modello, ma ha anche efficacemente ridotto i pregiudizi del modello, risolvendo il comune problema di "squilibrio" nei modelli multilingue.
tagPanoramica delle caratteristiche del modello
Caratteristica 1: Integrazione bilingue senza soluzione di continuità
Il modello jina-embeddings-v2-base-zh elabora fluidamente testi in cinese e inglese, sia come query di ricerca che come documenti target. I contenuti semanticamente simili in entrambe le lingue vengono mappati nello stesso spazio vettoriale, creando una solida base per applicazioni multilingue.
Caratteristica 2: Supporto per testi lunghi fino a 8K Token
Il nostro modello supporta l'elaborazione di testi fino a 8K Token, una caratteristica unica tra i modelli di embedding open source, offrendo un notevole vantaggio nell'elaborazione di paragrafi più lunghi.
Caratteristica 3: Struttura del modello efficiente e compatta
Il modello jina-embeddings-v2-base-zh, con le sue dimensioni compatte di 322MB (includendo 161 milioni di parametri) e una dimensione di output di 768, può funzionare efficientemente su hardware standard senza necessità di GPU, aumentando notevolmente la sua praticità e convenienza.
tagPrestazioni eccezionali del modello
Nella competitiva classifica CMTEB, il nostro modello Jina Embeddings v2 si distingue nella categoria dei modelli sotto 0.5GB, non solo supportando testi in cinese e inglese, ma anche gestendo testi fino a 8K Token, una capacità rara tra i modelli simili.

Tra i modelli di dimensioni simili che supportano il cinese, Multilingual E5 e il nostro jina-embeddings-v2-base-zh sono gli unici due capaci di elaborare l'inglese, rendendo possibili le applicazioni multilingue.

Attualmente, a livello globale, solo il modello proprietario text-embedding-ada-002 di OpenAI e Jina Embeddings supportano input di testo lungo fino a 8k Token. Per quanto riguarda l'elaborazione di compiti in cinese, Jina Embeddings mostra vantaggi prestazionali significativi.

tagSupporto alle aziende cinesi nell'espansione globale
Il nostro modello di embedding bilingue cinese-inglese jina-embeddings-v2-base-zh è un potente alleato per le aziende cinesi che si espandono nei mercati internazionali. È in grado di elaborare perfettamente testi bilingui cinese-inglese, fornire rappresentazioni vettoriali di alta qualità e integrarsi facilmente con database vettoriali avanzati, sistemi di ricerca e applicazioni RAG.
Questo modello è particolarmente adatto per creare applicazioni AI che si adattano a scenari bilingui cinese-inglese, ed è di inestimabile valore per le aziende che perseguono uno sviluppo globale. Ecco alcuni casi d'uso pratici:
- Analisi e gestione documentale: analisi e gestione di grandi volumi di documenti, facilitando transazioni legali e commerciali internazionali.
- Applicazioni di ricerca basate su AI: migliorare le performance di ricerca in ambienti multilingue, aiutando gli utenti globali a trovare facilmente informazioni in cinese e inglese.
- Chatbot e sistemi di Q&A con funzionalità di recupero avanzate: creare chatbot di servizio clienti bilingue efficienti, ottimizzando l'esperienza di comunicazione con i clienti globali.
- Applicazioni di Natural Language Processing: topic modeling per l'analisi dei trend di mercato globali e strategie di mercato internazionali, oltre alla classificazione del testo per la gestione delle comunicazioni globali.
- Sistemi di raccomandazione: sfruttare insights dai dati in cinese e inglese per fornire raccomandazioni personalizzate di prodotti e contenuti a un pubblico globale diversificato.
Grazie a questo modello, le aziende cinesi possono superare le barriere linguistiche nelle applicazioni AI e ottenere un vantaggio competitivo nel mercato globale.
tagIniziare facilmente con jina-embeddings-v2-base-zh
Volete integrare rapidamente il nostro modello di embedding bilingue nel vostro workflow? Bastano pochi semplici passaggi: visitate https://jina.ai/embeddings, ottenete la vostra API key gratuita o aggiornate quella esistente, poi selezionate jina-embeddings-v2-base-zh dal menu a tendina e il vostro modello sarà pronto per essere esplorato e utilizzato!


tagGuardando al futuro: supporto multilingue e integrazione profonda con AWS SageMaker
jina-embeddings-v2-base-zh sarà presto disponibile su AWS SageMaker e HuggingFace, offrendo un servizio ancora più conveniente agli utenti.


Stiamo attivamente sviluppando modelli di embedding multilingue, in particolare per le lingue europee e altre lingue internazionali, per soddisfare le diverse esigenze degli utenti globali. Restate sintonizzati per gli entusiasmanti aggiornamenti in arrivo, inclusa la profonda integrazione con AWS SageMaker, mentre continuiamo ad approfondire ed espandere la nostra gamma di servizi.
tagRingraziamenti: grazie per il prezioso contributo dei primi tester
Ringraziamo sinceramente i membri della comunità cinese che hanno partecipato al test di jina-embeddings-v2-base-zh-preview. Il vostro prezioso feedback ha giocato un ruolo importante nell'ottimizzazione del nostro modello. Se avete suggerimenti o idee durante l'utilizzo, non esitate a condividerli con noi. Ogni vostro feedback è la forza trainante del nostro continuo miglioramento.

La versione ufficiale risolve il problema dell'inflazione dei punteggi della versione preview
Rispetto alla precedente versione preview, il modello ufficiale fornisce punteggi di similarità più distribuiti e ragionevoli. Durante i test della versione preview, il nostro modello mostrava un fenomeno di inflazione nei punteggi di similarità, dove anche parole completamente non correlate come 'Annie' e 'macchina a vapore' ottenevano un'alta similarità del coseno. Nella versione ufficiale, abbiamo ottimizzato il modello per garantire punteggi di similarità più ragionevoli, riflettendo così più accuratamente le relazioni tra i contenuti.
Inoltre, Jina Embeddings ora supporta l'elaborazione di testi fino a 8192 Token, dimostrando la sua potente capacità di gestire vari tipi di dati, che si tratti di lunghi saggi, brevi frasi o singole parole o nomi (come il confronto tra "Annie" e "Luna"). Questo miglioramento non solo aumenta l'accuratezza del modello, ma ne migliora anche la flessibilità e l'utilità pratica nell'elaborazione di dati diversificati.







