I/O 図

テキスト

jina-embeddings-v2-base-zh

ベクター

パレートフロン
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…パラメータ数(対数)score
このモデル
フロン上
Jina AI
その他
C-MTEB
63.79
パラメータ
161M
スコア順位
23 / 40
パレートフロン
フロン未満
値の分布
AUC 0.8373
コーパス
翻訳ペア
ドキュメント検索
0.6820.000.200.400.600.80
関連12.6%
ハードネガティブ1.8%
無関連1.2%
推奨しきい値
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
バランス · 0.353
AUC
0.8373
ノイズ上限
0.793
再現率の崖
0.113
測定ペア数
119 / 11k
ベクトル成分
-0.180.000.18
σ 0.0361 · 183k 個の値
埋め込みの幾何
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.308
実効次元数
56 / 768
比較するモデルを選択してください
論文 (1)

概要

jina-embeddings-v2-base-zh は中国語・英語の 161M パラメータのバイリンガルテキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウと 768 次元の出力を備えます。長コンテキスト対応で中国語と英語の両方をシームレスに処理した最初のオープンソースモデルであり、トランスフォーマーアーキテクチャにおける中国語の文字ベーステキスト特有のトークナイズ化課題に対処しました。

方法

モデルは対称双方向 ALiBi 位置エンコーディングを備えた BERT ベースのバックボーン、161M パラメータ、768 次元の出力空間を使用します。訓練は 3 段階のアプローチに従いました:高品質な中国語-英語バイリンガルデータでの初期事前学習に続き、対比損失と困難負サンプルマイニングを伴う一次・二次ファインチューニング段階。ALiBi メカニズムにより、学習済み位置埋め込みなしで 8,192 トークンのコンテキストウィンドウが可能になりました。最終リリースの注目すべき改善は、プレビュー版に存在したスコア膨張の問題に対処した洗練された類似度スコアの分布で、より識別力があり適切に較正された類似度スコアを生成します。

パフォーマンス

C-MTEB(中国語 MTEB)リーダーボードで、モデルは 0.5GB 未満のモデル群の中で卓越した性能を示し、特に中国語タスクで優れた結果を記録しました。中国語固有の検索と類似性タスクでは OpenAI の text-embedding-ada-002 を大幅に上回ると同時に、英語タスクでも競争力のある性能を維持しました。洗練された類似度スコアの分布により、両言語で関連と非関連のコンテンツ間の識別が向上しました。2026 年、jina-embeddings-v5-text-small が 89 言語、32K コンテキスト、タスク固有 LoRA アダプタによりこのモデルに取って代わります。

ベストプラクティス

中国語-英語のバイリンガル検索、クロスリンガル文書検索、多言語コンテンツ解析に最適です。8,192 トークンを超える文書には、セマンティックチャンキングまたは Jina API 経由の `late_chunking パラメータを使用してください。モデルは主要なベクトルデータベースと RAG フレームワークと統合できます。新しい多言語プロジェクトには、jina-embeddings-v5-text-small`(89 言語、32K コンテキスト、LoRA アダプタ)を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。入力テキストは中国語または英語にしてください。モデルは翻訳なしで両言語をネイティブに処理します。

このモデルについて言及しているブログ