Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Punti Salienti
Performance Leader su C-MTEB
Potenziare le Imprese Cinesi per l'Espansione Globale
Inizia con jina-embeddings-v2-base-zh via API
Prossimi Passi: Espansione del Supporto Linguistico e Integrazione AWS Sagemaker
Un Ringraziamento Speciale ai Nostri Early Tester
Nuovo modello bilingue cinese-inglese di embedding 8K, essenziale per l'espansione globale delle aziende!
comunicato stampa
gennaio 09, 2024

Embeddings Bilingue a 8K Token Abbattono le Barriere Linguistiche tra Cinese e Inglese

Il primo modello di embedding bilingue cinese-inglese con lunghezza di token di 8192.
Colorful 3D text "OPEN" in green and blue on a black background creating a vibrant effect
Jina AI • 11 minuti letti

In seguito al notevole successo dei precedenti Embeddings V2, siamo entusiasti di annunciare il lancio del nostro ultimo modello di embedding testuale bilingue cinese/inglese: jina-embeddings-v2-base-zh. Questo nuovo modello eredita l'eccezionale lunghezza di 8K token di Jina Embeddings V2, ora con un robusto supporto sia per il cinese che per l'inglese.

jina-embeddings-v2-base-zh si distingue per la sua qualità e prestazioni eccezionali, ottenute attraverso un rigoroso e bilanciato pre-training con dati bilingue di alta qualità. Questo approccio garantisce una significativa riduzione del bias, spesso presente nei modelli addestrati con dati multilingue non bilanciati.

tagPunti Salienti

  • Modello Bilingue: Questo modello codifica testi sia in inglese che in cinese, permettendo l'uso di entrambe le lingue come query o documento target. I testi con significati equivalenti in queste lingue vengono mappati nello stesso spazio di embedding, formando la base per numerose applicazioni multilingue.
  • Lunghezza Estesa di 8K Token: Il nostro modello è in grado di elaborare passaggi di testo significativamente ampi, una caratteristica che supera le capacità della maggior parte degli altri modelli open-source.
  • Compatto ed Efficiente: Con una dimensione di 322MB (161 milioni di parametri) e dimensioni di output di 768, il nostro modello è progettato per alte prestazioni su hardware standard senza GPU, migliorandone l'accessibilità.

tagPerformance Leader su C-MTEB

Nella classifica Chinese MTEB, il nostro Jina Embeddings v2, che supporta sia il cinese che l'inglese, si distingue come uno dei migliori modelli sotto 0.5GB. Ciò che lo rende unico è la sua impressionante capacità di gestire 8K token, una caratteristica unica nella sua categoria.

Table comparing Chinese AI models' rankings and statistics, including model names, sizes, and C-MTEB scores

Tra i modelli cinesi di dimensioni simili, solo il modello E5 Multilingual e il nostro jina-embeddings-v2-base-zh offrono supporto per l'inglese, consentendo efficaci applicazioni cross-language. In particolare, Jina dimostra prestazioni significativamente superiori in tutte le categorie che coinvolgono la lingua cinese.

Technical table comparing performance of language retrieval models, including average and overall scores for tasks like Eng-to-Chn

Mentre entrambi i modelli hanno una dimensione di contesto di 8K token, jina-embeddings-v2-base-zh supera significativamente text-embedding-ada-002 di OpenAI, specialmente nei compiti che coinvolgono la lingua cinese.

Comparative table of AI models with columns for model name, size, context, embedding size, and C-MTEB average score

tagPotenziare le Imprese Cinesi per l'Espansione Globale

Il nostro modello di embedding cinese-inglese è uno strumento potente per le aziende cinesi che cercano di "andare globali". Elabora senza problemi i testi cinesi, fornendo embedding di alta qualità che si integrano facilmente con i principali database vettoriali, sistemi di ricerca e applicazioni RAG.

jina-embeddings-v2-base-zh è particolarmente vantaggioso per lo sviluppo di applicazioni AI adattate ai contesti cinese-inglese, cruciali per le imprese in espansione internazionale. Ecco alcuni casi d'uso specifici:

  1. Analisi e Gestione Documenti: Può analizzare e gestire una vasta gamma di documenti, supportando transazioni legali e commerciali internazionali.
  2. Applicazioni di Ricerca basate su AI: Migliora le funzioni di ricerca in ambienti multilingue, facilitando agli utenti globali la ricerca di informazioni rilevanti in cinese e inglese.
  3. Chatbot con Recupero di Informazioni e Risposta a Domande: Costruisce bot di servizio clienti bilingui efficienti, migliorando le interazioni con i clienti in tutto il mondo.
  4. Applicazioni di Elaborazione del Linguaggio Naturale: Include analisi del sentimento per comprendere le tendenze del mercato globale, modellazione di argomenti per strategie di marketing internazionale e classificazione del testo per gestire la comunicazione globale.
  5. Sistemi di Raccomandazione: Personalizza raccomandazioni di prodotti e contenuti per diversi pubblici globali, utilizzando insight tratti da dati cinesi e inglesi.

Sfruttando questo modello, le imprese cinesi possono colmare efficacemente il divario linguistico nelle loro applicazioni AI, migliorando la loro competitività globale e la portata di mercato.

tagInizia con jina-embeddings-v2-base-zh via API

Inizia subito a integrare il nostro modello nel tuo flusso di lavoro attraverso l'API Embeddings. Visita semplicemente il nostro portale Embeddings, ottieni la tua chiave di accesso gratuita o ricarica una chiave esistente, quindi scegli jina-embeddings-v2-base-zh dal menu a tendina. È così facile iniziare!

Embedding API
Top-performing, 8192-token context length, $100 for 1.25B tokens, seamless OpenAI alternative, free trial
AI platform interface with options like USAGE and TEST, and highlighting the "Chinese-English bilingual embeddings with SOTA performance.

tagProssimi Passi: Espansione del Supporto Linguistico e Integrazione AWS Sagemaker

jina-embeddings-v2-base-zh sarà presto disponibile tramite AWS Sagemaker e Hugging Face.

AWS Marketplace: Jina AI
jinaai (Jina AI)
embeddings, prompts, multimodal AI

In Jina AI, il nostro impegno a essere leader nella tecnologia di embedding accessibile e conveniente per un pubblico globale è incrollabile. Stiamo attivamente sviluppando ulteriori offerte multilingue, concentrandoci sulle principali lingue europee e altre lingue internazionali, per ampliare la nostra portata. Restate sintonizzati per questi entusiasmanti aggiornamenti, inclusa l'integrazione con AWS SageMaker, mentre continuiamo a espandere le nostre capacità.

tagUn Ringraziamento Speciale ai Nostri Early Tester

Siamo immensamente grati ai membri selezionati della nostra comunità di utenti cinesi che hanno testato la versione preview (jina-embeddings-v2-base-zh-preview). Il loro feedback perspicace è stato cruciale per migliorare le prestazioni della versione ufficiale per questo rilascio. Se hai osservazioni o suggerimenti riguardo alla qualità dei nostri modelli, ti invitiamo calorosamente a unirti al nostro server Discord e condividere i tuoi pensieri con noi. Il tuo input è inestimabile nel nostro percorso di miglioramento continuo.

Unisciti al Server Discord di Jina AI!
Unisciti alla community Jina AI su Discord - interagisci con altri 4182 membri e goditi chat vocali e testuali gratuite.
Discord

Migliore distribuzione dei punteggi rispetto a jina-embeddings-v2-base-zh-preview

jina-embeddings-v2-base-zh-preview soffriva di punteggi di similarità gonfiati, portando a alti punteggi di coseno anche per elementi non correlati. Questo era particolarmente evidente nei primi 5 risultati dello screenshot qui sotto. I punteggi di similarità erano costantemente alti e non riflettevano accuratamente la vera relazione tra gli elementi. Ad esempio, il confronto tra "安妮" e "蒸汽机" riceveva punteggi di similarità fuorvianti.

Nella release ufficiale, abbiamo perfezionato il modello per produrre punteggi di similarità più distinti e logici, garantendo una rappresentazione più accurata delle relazioni tra gli elementi. Per esempio, il nuovo sistema di punteggio presenta ora un intervallo più ampio, offrendo una visione più chiara della similarità relativa tra gli elementi.

Inoltre, Jina Embeddings si distingue ora come l'unico modello di embedding open-source che supporta 8192 token. Questa caratteristica evidenzia la sua capacità di elaborare un'ampia varietà di tipi di dati, dai documenti estesi alle frasi brevi, o persino singole parole/nomi come "安妮" vs "露娜".

Tabella che confronta i punteggi di similarità tra il carattere "安妮" e vari altri, con righe per diversi caratteri e colonne per gli attributi di similarità

tagNuovo modello bilingue cinese-inglese di embedding 8K, essenziale per l'espansione globale delle aziende!

Dopo il successo di Embeddings V2, oggi lanciamo il nostro nuovo modello di embedding testuale bilingue cinese-inglese: jina-embeddings-v2-base-zh. Questo modello non solo eredita tutti i vantaggi di V2, con la capacità di elaborare testi fino a 8000 token, ma gestisce anche perfettamente contenuti bilingui cinese-inglese, aprendo le porte alle applicazioni multilingue.

L'eccellente performance di jina-embeddings-v2-base-zh è dovuta al dataset bilingue di alta qualità e al nostro rigoroso ed equilibrato processo di pre-training, fine-tuning primario e fine-tuning secondario. Questo approccio in tre fasi non solo ha generalizzato le capacità bilingui del modello, ma ha anche efficacemente ridotto i pregiudizi del modello, risolvendo il comune problema di "squilibrio" nei modelli multilingue.

tagPanoramica delle caratteristiche del modello

Caratteristica 1: Integrazione bilingue senza soluzione di continuità

Il modello jina-embeddings-v2-base-zh elabora fluidamente testi in cinese e inglese, sia come query di ricerca che come documenti target. I contenuti semanticamente simili in entrambe le lingue vengono mappati nello stesso spazio vettoriale, creando una solida base per applicazioni multilingue.

Caratteristica 2: Supporto per testi lunghi fino a 8K Token

Il nostro modello supporta l'elaborazione di testi fino a 8K Token, una caratteristica unica tra i modelli di embedding open source, offrendo un notevole vantaggio nell'elaborazione di paragrafi più lunghi.

Caratteristica 3: Struttura del modello efficiente e compatta

Il modello jina-embeddings-v2-base-zh, con le sue dimensioni compatte di 322MB (includendo 161 milioni di parametri) e una dimensione di output di 768, può funzionare efficientemente su hardware standard senza necessità di GPU, aumentando notevolmente la sua praticità e convenienza.

tagPrestazioni eccezionali del modello

Nella competitiva classifica CMTEB, il nostro modello Jina Embeddings v2 si distingue nella categoria dei modelli sotto 0.5GB, non solo supportando testi in cinese e inglese, ma anche gestendo testi fino a 8K Token, una capacità rara tra i modelli simili.

Grafico che confronta modelli AI cinesi con dettagli come nomi, dimensioni, dimensioni di embedding e punteggi medi C-MTEB

Tra i modelli di dimensioni simili che supportano il cinese, Multilingual E5 e il nostro jina-embeddings-v2-base-zh sono gli unici due capaci di elaborare l'inglese, rendendo possibili le applicazioni multilingue.

Tabella di confronto dati dei modelli di recupero linguistico con metriche per recuperi Ing-a-Cin, Cin-a-Ing e Ing-a-Ing

Attualmente, a livello globale, solo il modello proprietario text-embedding-ada-002 di OpenAI e Jina Embeddings supportano input di testo lungo fino a 8k Token. Per quanto riguarda l'elaborazione di compiti in cinese, Jina Embeddings mostra vantaggi prestazionali significativi.

Una tabella dettagliata che confronta tre modelli AI, evidenziando dimensioni, contesto, dimensioni di embedding e punteggio medio C-MTEB

tagSupporto alle aziende cinesi nell'espansione globale

Il nostro modello di embedding bilingue cinese-inglese jina-embeddings-v2-base-zh è un potente alleato per le aziende cinesi che si espandono nei mercati internazionali. È in grado di elaborare perfettamente testi bilingui cinese-inglese, fornire rappresentazioni vettoriali di alta qualità e integrarsi facilmente con database vettoriali avanzati, sistemi di ricerca e applicazioni RAG.
Questo modello è particolarmente adatto per creare applicazioni AI che si adattano a scenari bilingui cinese-inglese, ed è di inestimabile valore per le aziende che perseguono uno sviluppo globale. Ecco alcuni casi d'uso pratici:

  • Analisi e gestione documentale: analisi e gestione di grandi volumi di documenti, facilitando transazioni legali e commerciali internazionali.
  • Applicazioni di ricerca basate su AI: migliorare le performance di ricerca in ambienti multilingue, aiutando gli utenti globali a trovare facilmente informazioni in cinese e inglese.
  • Chatbot e sistemi di Q&A con funzionalità di recupero avanzate: creare chatbot di servizio clienti bilingue efficienti, ottimizzando l'esperienza di comunicazione con i clienti globali.
  • Applicazioni di Natural Language Processing: topic modeling per l'analisi dei trend di mercato globali e strategie di mercato internazionali, oltre alla classificazione del testo per la gestione delle comunicazioni globali.
  • Sistemi di raccomandazione: sfruttare insights dai dati in cinese e inglese per fornire raccomandazioni personalizzate di prodotti e contenuti a un pubblico globale diversificato.

Grazie a questo modello, le aziende cinesi possono superare le barriere linguistiche nelle applicazioni AI e ottenere un vantaggio competitivo nel mercato globale.

tagIniziare facilmente con jina-embeddings-v2-base-zh

Volete integrare rapidamente il nostro modello di embedding bilingue nel vostro workflow? Bastano pochi semplici passaggi: visitate https://jina.ai/embeddings, ottenete la vostra API key gratuita o aggiornate quella esistente, poi selezionate jina-embeddings-v2-base-zh dal menu a tendina e il vostro modello sarà pronto per essere esplorato e utilizzato!

Embedding API
Top-performing, 8192-token context length, $100 for 1.25B tokens, seamless OpenAI alternative, free trial
Technical webpage displaying code and API references with sections for usage, FAQ, and model details

tagGuardando al futuro: supporto multilingue e integrazione profonda con AWS SageMaker

jina-embeddings-v2-base-zh sarà presto disponibile su AWS SageMaker e HuggingFace, offrendo un servizio ancora più conveniente agli utenti.

AWS Marketplace: Jina AI
jinaai (Jina AI)
embeddings, prompts, multimodal AI

Stiamo attivamente sviluppando modelli di embedding multilingue, in particolare per le lingue europee e altre lingue internazionali, per soddisfare le diverse esigenze degli utenti globali. Restate sintonizzati per gli entusiasmanti aggiornamenti in arrivo, inclusa la profonda integrazione con AWS SageMaker, mentre continuiamo ad approfondire ed espandere la nostra gamma di servizi.

tagRingraziamenti: grazie per il prezioso contributo dei primi tester

Ringraziamo sinceramente i membri della comunità cinese che hanno partecipato al test di jina-embeddings-v2-base-zh-preview. Il vostro prezioso feedback ha giocato un ruolo importante nell'ottimizzazione del nostro modello. Se avete suggerimenti o idee durante l'utilizzo, non esitate a condividerli con noi. Ogni vostro feedback è la forza trainante del nostro continuo miglioramento.

Join the Jina AI Discord Server!
Check out the Jina AI community on Discord - hang out with 4182 other members and enjoy free voice and text chat.
Discord

La versione ufficiale risolve il problema dell'inflazione dei punteggi della versione preview

Rispetto alla precedente versione preview, il modello ufficiale fornisce punteggi di similarità più distribuiti e ragionevoli. Durante i test della versione preview, il nostro modello mostrava un fenomeno di inflazione nei punteggi di similarità, dove anche parole completamente non correlate come 'Annie' e 'macchina a vapore' ottenevano un'alta similarità del coseno. Nella versione ufficiale, abbiamo ottimizzato il modello per garantire punteggi di similarità più ragionevoli, riflettendo così più accuratamente le relazioni tra i contenuti.

Inoltre, Jina Embeddings ora supporta l'elaborazione di testi fino a 8192 Token, dimostrando la sua potente capacità di gestire vari tipi di dati, che si tratti di lunghi saggi, brevi frasi o singole parole o nomi (come il confronto tra "Annie" e "Luna"). Questo miglioramento non solo aumenta l'accuratezza del modello, ma ne migliora anche la flessibilità e l'utilità pratica nell'elaborazione di dati diversificati.

Detailed table with sentence similarity scores for Chinese entities, showcasing precision and recall values ranging from 0 to 1
Categorie:
comunicato stampa
rss_feed

Per saperne di più
agosto 03, 2026 • 11 minuti letti
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
maggio 12, 2026 • 7 minuti letti
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
febbraio 19, 2026 • 7 minuti letti
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.