概要
jina-embeddings-v2-base-zh は中国語・英語の 161M パラメータのバイリンガルテキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウと 768 次元の出力を備えます。長コンテキスト対応で中国語と英語の両方をシームレスに処理した最初のオープンソースモデルであり、トランスフォーマーアーキテクチャにおける中国語の文字ベーステキスト特有のトークナイズ化課題に対処しました。
方法
モデルは対称双方向 ALiBi 位置エンコーディングを備えた BERT ベースのバックボーン、161M パラメータ、768 次元の出力空間を使用します。訓練は 3 段階のアプローチに従いました:高品質な中国語-英語バイリンガルデータでの初期事前学習に続き、対比損失と困難負サンプルマイニングを伴う一次・二次ファインチューニング段階。ALiBi メカニズムにより、学習済み位置埋め込みなしで 8,192 トークンのコンテキストウィンドウが可能になりました。最終リリースの注目すべき改善は、プレビュー版に存在したスコア膨張の問題に対処した洗練された類似度スコアの分布で、より識別力があり適切に較正された類似度スコアを生成します。
パフォーマンス
C-MTEB(中国語 MTEB)リーダーボードで、モデルは 0.5GB 未満のモデル群の中で卓越した性能を示し、特に中国語タスクで優れた結果を記録しました。中国語固有の検索と類似性タスクでは OpenAI の text-embedding-ada-002 を大幅に上回ると同時に、英語タスクでも競争力のある性能を維持しました。洗練された類似度スコアの分布により、両言語で関連と非関連のコンテンツ間の識別が向上しました。2026 年、jina-embeddings-v5-text-small が 89 言語、32K コンテキスト、タスク固有 LoRA アダプタによりこのモデルに取って代わります。
ベストプラクティス
中国語-英語のバイリンガル検索、クロスリンガル文書検索、多言語コンテンツ解析に最適です。8,192 トークンを超える文書には、セマンティックチャンキングまたは Jina API 経由の `late_chunking パラメータを使用してください。モデルは主要なベクトルデータベースと RAG フレームワークと統合できます。新しい多言語プロジェクトには、jina-embeddings-v5-text-small`(89 言語、32K コンテキスト、LoRA アダプタ)を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。入力テキストは中国語または英語にしてください。モデルは翻訳なしで両言語をネイティブに処理します。







