Aperçu
jina-embeddings-v2-base-zh est un modèle d'embedding de texte bilingue de 161M paramètres pour le chinois et l'anglais, avec une fenêtre de contexte de 8 192 tokens et une sortie de 768 dimensions. Il fut le premier modèle open source à traiter le chinois et l'anglais sans couture avec un support du long contexte, abordant les défis uniques de tokenisation du texte chinois basé sur les caractères dans les architectures transformeur.
Méthodes
Le modèle utilise un backbone basé sur BERT avec des encodings positionnels ALiBi bidirectionnels symétriques, 161M paramètres et un espace de sortie de 768 dimensions. L'entraînement a suivi une approche en trois phases : un pré-entraînement initial sur des données bilingues de haute qualité chinois-anglais, suivi d'étapes d'ajustement fin primaire et secondaire avec une perte contrastive et le minage de négatifs difficiles. Le mécanisme ALiBi permet la fenêtre de contexte de 8 192 tokens sans embeddings positionnels appris. Une amélioration notable dans la version finale fut une distribution de scores de similarité affinée qui a corrigé les problèmes d'inflation de scores présents dans la version d'aperçu, produisant des scores de similarité plus discriminants et mieux calibrés.
Performance
Sur le leaderboard C-MTEB (MTEB chinois), le modèle a montré une performance exceptionnelle parmi les modèles de moins de 0,5Go, se distinguant particulièrement sur les tâches en chinois. Il a nettement surpassé text-embedding-ada-002 d'OpenAI sur les tâches de recherche et de similarité spécifiques au chinois, tout en maintenant une performance compétitive sur les tâches en anglais. La distribution affinée des scores de similarité a amélioré la discrimination entre les contenus apparentés et non apparentés dans les deux langues. En 2026, jina-embeddings-v5-text-small remplace ce modèle avec 89 langues, un contexte de 32K et des adaptateurs LoRA spécifiques aux tâches.
Conseils
Optimal pour la recherche bilingue chinois-anglais, la recherche interlingue de documents et l'analyse de contenu multilingue. Pour les documents dépassant 8 192 tokens, utilisez le découpage sémantique ou le paramètre `late_chunking via l'API Jina. Le modèle s'intègre avec les principales bases de données vectorielles et les frameworks RAG. Pour les nouveaux projets multilingues, préférez jina-embeddings-v5-text-small` (89 langues, contexte de 32K, adaptateurs LoRA). Une GPU compatible CUDA est recommandée pour le débit en production. Le texte d'entrée doit être en chinois ou en anglais ; le modèle traite les deux langues nativement sans traduction.







