Grafico I/O

Testo

jina-embeddings-v2-base-zh

Vettore

Frontiera di Pareto
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…Parametri (log)score
Questo modello
Sulla frontiera
Jina AI
Altri
C-MTEB
63.79
Parametri
161M
Classifica per punteggio
23 / 40
Frontiera di Pareto
Dietro
Distribuzione dei valori
AUC 0.8373
Corpus
Coppie di traduzione
Ricerca documentale
0.6820.000.200.400.600.80
Correlate12.6%
Negativo difficile1.8%
Non correlate1.2%
Soglie consigliate
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
bilanciata · 0.353
AUC
0.8373
Soglia del rumore
0.793
Crollo del richiamo
0.113
Coppie misurate
119 / 11k
Componenti del vettore
-0.180.000.18
σ 0.0361 · 183k valori
Geometria dell'embedding
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.308
Dim. effettive
56 / 768
Scegli i modelli da confrontare
Pubblicazioni (1)

Panoramica

jina-embeddings-v2-base-zh è un modello di embedding del testo bilingue da 161M parametri per cinese e inglese, con una finestra di contesto di 8.192 token e output a 768 dimensioni. È stato il primo modello open source in grado di gestire cinese e inglese in modo fluido con supporto al lungo contesto, affrontando le uniche sfide di tokenizzazione del testo cinese basato sui caratteri nelle architetture transformer.

Metodi

Il modello usa un backbone basato su BERT con codifiche posizionali ALiBi bidirezionali simmetriche, 161M parametri e uno spazio di output a 768 dimensioni. L'addestramento ha seguito un approccio in tre fasi: pre-addestramento iniziale su dati bilingue di alta qualità cinese-inglese, seguito da stadi di fine-tuning primario e secondario con perdita contrastiva e mining di negativi difficili. Il meccanismo ALiBi abilita la finestra di contesto di 8.192 token senza embedding posizionali appresi. Un miglioramento notevole nella versione finale fu una distribuzione di punteggi di similarità affinata che affrontò i problemi di inflazione dei punteggi presenti nella versione di anteprima, producendo punteggi di similarità più discriminativi e ben calibrati.

Prestazione

Sulla leaderboard C-MTEB (MTEB cinese), il modello ha dimostrato una prestazione eccellente tra i modelli di meno di 0,5GB, distinguendosi in particolare nei task in cinese. Ha nettamente superato text-embedding-ada-002 di OpenAI nei task di retrieval e similarità specifici del cinese, mantenendo prestazioni competitive nei task in inglese. La distribuzione affinata dei punteggi di similarità ha migliorato la discriminazione tra contenuto correlato e non correlato in entrambe le lingue. Nel 2026, jina-embeddings-v5-text-small rimpiazza questo modello con 89 lingue, contesto di 32K e adattatori LoRA specifici per il task.

Orientamento

Ottimale per la retrieval bilingue cinese-inglese, la ricerca cross-linguistica dei documenti e l'analisi di contenuto multilingua. Per documenti che superano 8.192 token, usa il chunking semantico o il parametro `late_chunking tramite l'API di Jina. Il modello si integra con i principali database vettoriali e framework RAG. Per nuovi progetti multilingua, preferisci jina-embeddings-v5-text-small` (89 lingue, contesto di 32K, adattatori LoRA). GPU con supporto CUDA consigliata per il throughput di produzione. Il testo in input dovrebbe essere in cinese o in inglese; il modello gestisce entrambe le lingue nativamente senza traduzione.

Blog che menzionano questo modello