概要
jina-embeddings-v2-base-code は 161M パラメータのコード埋め込みモデルで、30 言語のプログラミングコードを共有する 768 次元の意味空間にマッピングします。8,192 トークンのコンテキストウィンドウにより、切り詰めなしの関数全体および複数ファイルのコード検索をサポートした最初の Jina 埋め込みモデルとなりました。リリース時には CodeNetSearch ベンチマーク 15 本のうち 9 本でトップでした。
方法
モデルは 161M パラメータのトランスフォーマーベースのエンコーダーを使用し、Python、JavaScript、Java、PHP、Go、Ruby に重点を置いた多様なプログラミング言語データセットで訓練されました。8,192 トークンのコンテキストウィンドウ(ALiBi 位置エンコーディングにより)により、関数全体や小さなファイルを単一のフォワードパスで処理できます。訓練には、コード-テキストペア(自然言語の説明とコード実装のペア)での対比事前学習と、困難負サンプルマイニングを伴うコード検索データセットでの教師ありファインチューニングが含まれます。768 次元の埋め込みは統語構造と意味の両方を捉え、異なる言語で機能等価なコードが埋め込み空間の近傍領域にマッピングされるクロス言語コードマッチングを可能にします。
パフォーマンス
リリース時、モデルは CodeNetSearch ベンチマーク 15 本中 9 本でトップであり、Microsoft や Salesforce のコード埋め込みモデルを上回りながら、より効率的な 307MB のフットプリントを維持していました。8,192 トークンのコンテキストは競合のコード埋め込みモデルの 4–16 倍の大きさで、ファイル全体や複雑なコードブロックにわたる検索を可能にしました。クロス言語コード理解は特筆すべき強みで、異なるプログラミング言語間の機能等価スニペットをマッチングできました。2026 年、jina-code-embeddings-0.5b と jina-code-embeddings-1.5b が自己回帰バックボーン、32K コンテキスト、大幅に高い検索精度によりこのモデルに取って代わります。
ベストプラクティス
単一言語またはクロス言語のコードベースでのコード検索、ドキュメント検索、コード再利用に使用してください。8,192 トークンを超えるドキュメントには、関数またはクラスの境界でチャンキングを実装してください。モデルはベクトルデータベース(Qdrant、Weaviate、MongoDB)および RAG フレームワークと統合できます。新規のコード検索プロジェクトでは、jina-code-embeddings-1.5b(1.5B パラメータ、32K コンテキスト、SOTA 精度)または jina-code-embeddings-0.5b(494M パラメータ、エッジフレンドリー)を推奨します。本番環境では CUDA 対応 GPU を推奨します。Python、JavaScript、Java、PHP、Go、Ruby で最高の性能を発揮し、30 以上の言語を段階的品質低下を伴ってサポートします。









