Panoramica
jina-embeddings-v2-base-zh è un modello di embedding del testo bilingue da 161M parametri per cinese e inglese, con una finestra di contesto di 8.192 token e output a 768 dimensioni. È stato il primo modello open source in grado di gestire cinese e inglese in modo fluido con supporto al lungo contesto, affrontando le uniche sfide di tokenizzazione del testo cinese basato sui caratteri nelle architetture transformer.
Metodi
Il modello usa un backbone basato su BERT con codifiche posizionali ALiBi bidirezionali simmetriche, 161M parametri e uno spazio di output a 768 dimensioni. L'addestramento ha seguito un approccio in tre fasi: pre-addestramento iniziale su dati bilingue di alta qualità cinese-inglese, seguito da stadi di fine-tuning primario e secondario con perdita contrastiva e mining di negativi difficili. Il meccanismo ALiBi abilita la finestra di contesto di 8.192 token senza embedding posizionali appresi. Un miglioramento notevole nella versione finale fu una distribuzione di punteggi di similarità affinata che affrontò i problemi di inflazione dei punteggi presenti nella versione di anteprima, producendo punteggi di similarità più discriminativi e ben calibrati.
Prestazione
Sulla leaderboard C-MTEB (MTEB cinese), il modello ha dimostrato una prestazione eccellente tra i modelli di meno di 0,5GB, distinguendosi in particolare nei task in cinese. Ha nettamente superato text-embedding-ada-002 di OpenAI nei task di retrieval e similarità specifici del cinese, mantenendo prestazioni competitive nei task in inglese. La distribuzione affinata dei punteggi di similarità ha migliorato la discriminazione tra contenuto correlato e non correlato in entrambe le lingue. Nel 2026, jina-embeddings-v5-text-small rimpiazza questo modello con 89 lingue, contesto di 32K e adattatori LoRA specifici per il task.
Orientamento
Ottimale per la retrieval bilingue cinese-inglese, la ricerca cross-linguistica dei documenti e l'analisi di contenuto multilingua. Per documenti che superano 8.192 token, usa il chunking semantico o il parametro `late_chunking tramite l'API di Jina. Il modello si integra con i principali database vettoriali e framework RAG. Per nuovi progetti multilingua, preferisci jina-embeddings-v5-text-small` (89 lingue, contesto di 32K, adattatori LoRA). GPU con supporto CUDA consigliata per il throughput di produzione. Il testo in input dovrebbe essere in cinese o in inglese; il modello gestisce entrambe le lingue nativamente senza traduzione.







