概要
jina-embeddings-v2-base-de は 161M パラメータのドイツ語・英語バイリンガルテキスト埋め込みモデルで、8,192 トークンのコンテキストウィンドウを備えます。両言語の意味的に等価なコンテンツを同じ 768 次元の埋め込み空間にマッピングし、翻訳なしのクロスリンガル検索を可能にします。モデルは、長コンテキスト対応を両言語のバランスの取れた性能と組み合わせた最初のオープンソースバイリンガル埋め込みモデルの一つでした。
方法
対称双方向 ALiBi 位置エンコーディングを備えた BERT ベースのバックボーン上に構築されたモデルは、161M パラメータの統一アーキテクチャを通じてドイツ語と英語の両方を処理し、768 次元の埋め込みを生成します。訓練には 3 段階が含まれます:(1) ドイツ語-英語平行コーパスでの多言語事前学習、(2) 困難負サンプルを伴うキュレーション済み文ペアでの対比ファインチューニング、(3) ドイツ語と英語の意味的に等価なテキストが埋め込み空間の近傍領域にマッピングされることを保証するクロスリンガルアラインメント訓練。主要な設計上の選択はバイアス最小化目的関数で、多言語モデルが英語の文法構造を偏って扱う傾向を打ち消します — これは以前の多言語埋め込みで文書化された既知の失敗モードです。ALiBi による 8,192 トークンのウィンドウにより、切り詰めなしでどちらの言語でも文書全体を処理できます。
パフォーマンス
モデルは Microsoft の E5-base を上回りながらそのサイズの 3 分の 1 以下であり、7 倍小さいながら E5-large の性能に匹敵しました。WikiCLIR(英語からドイツ語への検索)、STS17/STS22(双方向セマンティック類似性)、BUCC(バイリンガルテキストアラインメント)では、同等またはより大きなサイズのモデルを一貫して上回りました。322MB のフットプリントにより標準ハードウェアでのデプロイができました。2026 年、jina-embeddings-v5-text-small がほとんどのアプリケーションでこのモデルに取って代わり、32K コンテキスト、89 言語、タスク固有 LoRA アダプタを提供します。v2-base-de モデルは、8K コンテキストで十分なドイツ語-英語バイリンガルパイプラインでは引き続き有用です。
ベストプラクティス
ドイツ語-英語のバイリンガル検索に最適です:製品検索、サポートドキュメント、コンテンツ管理など、クエリと文書が異なる言語になり得る場面です。8,192 トークンを超えるドキュメントには、セマンティックチャンキングまたは Jina API 経由の `late_chunking パラメータを使用してください。モデルは Qdrant、Weaviate、MongoDB、Milvus と統合できます。2 言語を超える新しい多言語プロジェクトには、jina-embeddings-v5-text-small`(89 言語、32K コンテキスト、LoRA アダプタ)を推奨します。本番のスループットには CUDA 対応 GPU を推奨します。









