Überblick
jina-embeddings-v2-base-zh ist ein 161M-Parameter zweisprachiges Text-Embedding-Modell für Chinesisch und Englisch mit einem 8.192-Token-Kontextfenster und 768-dimensionalem Output. Es war das erste Open-Source-Modell, das Chinesisch und Englisch nahtlos mit Langkontext-Unterstützung verarbeitete, und adressierte die einzigartigen Tokenisierungs-Herausforderungen chinesischer zeichenbasierter Texte in Transformer-Architekturen.
Methoden
Das Modell verwendet einen BERT-basierten Backbone mit symmetrischen bidirektionalen ALiBi-Position-Encodings, 161M Parametern und einem 768-dimensionalen Output-Raum. Das Training folgte einem dreiphasigen Ansatz: zunächst Pretraining auf hochwertigen chinesisch-englischen zweisprachigen Daten, gefolgt von primären und sekundären Feinstuning-Stufen mit kontrastivem Loss und Hard-Negative-Mining. Der ALiBi-Mechanismus ermöglicht das 8.192-Token-Kontextfenster ohne erlernte Positions-Embeddings. Eine bemerkenswerte Verbesserung in der finalen Veröffentlichung war eine verfeinerte Similarity-Score-Verteilung, die Score-Inflations-Probleme der Preview-Version adressierte und diskriminativere, besser kalibrierte Similarity-Scores lieferte.
Leistung
Auf dem C-MTEB-(Chinesisch-MTEB-)Leaderboard zeigte das Modell hervorragende Performance unter Modellen unter 0,5GB, insbesondere bei chinesischsprachigen Aufgaben. Es übertraf OpenAIs text-embedding-ada-002 signifikant auf chinesisch-spezifischen Retrieval- und Similarity-Aufgaben, während es auf Englisch-Aufgaben konkurrenzfähige Performance behielt. Die verfeinerte Similarity-Score-Verteilung verbesserte die Diskriminierung zwischen verwandtem und unverbundenem Inhalt in beiden Sprachen. Im Jahr 2026 ersetzt jina-embeddings-v5-text-small dieses Modell mit 89 Sprachen, 32K-Kontext und task-spezifischen LoRA-Adaptern.
Anleitung
Optimal für chinesisch-englisches Zweisprach-Retrieval, cross-sprachliche Dokumentensuche und mehrsprachige Inhaltsanalyse. Für Dokumente über 8.192 Tokens semantisches Chunking oder den `late_chunking-Parameter über die Jina-API verwenden. Das Modell integriert sich mit großen Vektor-Datenbanken und RAG-Frameworks. Für neue mehrsprachige Projekte jina-embeddings-v5-text-small` bevorzugen (89 Sprachen, 32K-Kontext, LoRA-Adapter). CUDA-fähige GPU für Produktions-Durchsatz empfohlen. Die Eingabe sollte auf Chinesisch oder Englisch sein; das Modell verarbeitet beide Sprachen nativ ohne Übersetzung.







