E/A-Diagramm

Text

jina-embeddings-v2-base-zh

Vektor

Pareto-Front
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…Parameter (log)score
Dieses Modell
Auf der Front
Jina AI
Andere
C-MTEB
63.79
Parameter
161M
Rang nach Score
23 / 40
Pareto-Front
Dahinter
Werteverteilung
AUC 0.8373
Korpus
Übersetzungspaare
Dokumentensuche
0.6820.000.200.400.600.80
Verwandt12.6%
Hartes Negativ1.8%
Unverwandt1.2%
Empfohlene Schwellenwerte
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
ausgewogen · 0.353
AUC
0.8373
Rauschgrenze
0.793
Recall-Kante
0.113
Gemessene Paare
119 / 11k
Vektorkomponenten
-0.180.000.18
σ 0.0361 · 183k Werte
Einbettungsgeometrie
0768
Mittelwert je Dimension, für den Bereich überfahren
Rauschboden
0.308
Effektive Dim.
56 / 768
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-embeddings-v2-base-zh ist ein 161M-Parameter zweisprachiges Text-Embedding-Modell für Chinesisch und Englisch mit einem 8.192-Token-Kontextfenster und 768-dimensionalem Output. Es war das erste Open-Source-Modell, das Chinesisch und Englisch nahtlos mit Langkontext-Unterstützung verarbeitete, und adressierte die einzigartigen Tokenisierungs-Herausforderungen chinesischer zeichenbasierter Texte in Transformer-Architekturen.

Methoden

Das Modell verwendet einen BERT-basierten Backbone mit symmetrischen bidirektionalen ALiBi-Position-Encodings, 161M Parametern und einem 768-dimensionalen Output-Raum. Das Training folgte einem dreiphasigen Ansatz: zunächst Pretraining auf hochwertigen chinesisch-englischen zweisprachigen Daten, gefolgt von primären und sekundären Feinstuning-Stufen mit kontrastivem Loss und Hard-Negative-Mining. Der ALiBi-Mechanismus ermöglicht das 8.192-Token-Kontextfenster ohne erlernte Positions-Embeddings. Eine bemerkenswerte Verbesserung in der finalen Veröffentlichung war eine verfeinerte Similarity-Score-Verteilung, die Score-Inflations-Probleme der Preview-Version adressierte und diskriminativere, besser kalibrierte Similarity-Scores lieferte.

Leistung

Auf dem C-MTEB-(Chinesisch-MTEB-)Leaderboard zeigte das Modell hervorragende Performance unter Modellen unter 0,5GB, insbesondere bei chinesischsprachigen Aufgaben. Es übertraf OpenAIs text-embedding-ada-002 signifikant auf chinesisch-spezifischen Retrieval- und Similarity-Aufgaben, während es auf Englisch-Aufgaben konkurrenzfähige Performance behielt. Die verfeinerte Similarity-Score-Verteilung verbesserte die Diskriminierung zwischen verwandtem und unverbundenem Inhalt in beiden Sprachen. Im Jahr 2026 ersetzt jina-embeddings-v5-text-small dieses Modell mit 89 Sprachen, 32K-Kontext und task-spezifischen LoRA-Adaptern.

Anleitung

Optimal für chinesisch-englisches Zweisprach-Retrieval, cross-sprachliche Dokumentensuche und mehrsprachige Inhaltsanalyse. Für Dokumente über 8.192 Tokens semantisches Chunking oder den `late_chunking-Parameter über die Jina-API verwenden. Das Modell integriert sich mit großen Vektor-Datenbanken und RAG-Frameworks. Für neue mehrsprachige Projekte jina-embeddings-v5-text-small` bevorzugen (89 Sprachen, 32K-Kontext, LoRA-Adapter). CUDA-fähige GPU für Produktions-Durchsatz empfohlen. Die Eingabe sollte auf Chinesisch oder Englisch sein; das Modell verarbeitet beide Sprachen nativ ohne Übersetzung.

Blogs, die dieses Modell erwähnen