I/O 図

コード

jina-embeddings-v2-base-code

タスク

ベクター

パレートフロン
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3jina-embeddings-v4modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderパラメータ数(対数)nDCG@10
このモデル
フロン上
Jina AI
その他
CoIR
52.24
パラメータ
161M
スコア順位
19 / 31
パレートフロン
フロン未満
値の分布
AUC 0.8156
コーパス
翻訳ペア
ドキュメント検索
コード
0.7500.000.200.400.600.80
関連10.9%
ハードネガティブ1.5%
無関連1.0%
推奨しきい値
FPR 0.1 · 0.579
FPR 0.01 · 0.750
FPR 0.001 · 0.806
FPR 0.0001 · 0.839
バランス · 0.369
AUC
0.8156
ノイズ上限
0.805
再現率の崖
0.204
測定ペア数
119 / 11k
ベクトル成分
-0.160.040.25
σ 0.0361 · 183k 個の値
埋め込みの幾何
0768
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.404
実効次元数
43 / 768
比較するモデルを選択してください

概要

jina-embeddings-v2-base-code161M パラメータのコード埋め込みモデルで、30 言語のプログラミングコードを共有する 768 次元の意味空間にマッピングします。8,192 トークンのコンテキストウィンドウにより、切り詰めなしの関数全体および複数ファイルのコード検索をサポートした最初の Jina 埋め込みモデルとなりました。リリース時には CodeNetSearch ベンチマーク 15 本のうち 9 本でトップでした。

方法

モデルは 161M パラメータのトランスフォーマーベースのエンコーダーを使用し、Python、JavaScript、Java、PHP、Go、Ruby に重点を置いた多様なプログラミング言語データセットで訓練されました。8,192 トークンのコンテキストウィンドウ(ALiBi 位置エンコーディングにより)により、関数全体や小さなファイルを単一のフォワードパスで処理できます。訓練には、コード-テキストペア(自然言語の説明とコード実装のペア)での対比事前学習と、困難負サンプルマイニングを伴うコード検索データセットでの教師ありファインチューニングが含まれます。768 次元の埋め込みは統語構造と意味の両方を捉え、異なる言語で機能等価なコードが埋め込み空間の近傍領域にマッピングされるクロス言語コードマッチングを可能にします。

パフォーマンス

リリース時、モデルは CodeNetSearch ベンチマーク 15 本中 9 本でトップであり、Microsoft や Salesforce のコード埋め込みモデルを上回りながら、より効率的な 307MB のフットプリントを維持していました。8,192 トークンのコンテキストは競合のコード埋め込みモデルの 4–16 倍の大きさで、ファイル全体や複雑なコードブロックにわたる検索を可能にしました。クロス言語コード理解は特筆すべき強みで、異なるプログラミング言語間の機能等価スニペットをマッチングできました。2026 年、jina-code-embeddings-0.5bjina-code-embeddings-1.5b が自己回帰バックボーン、32K コンテキスト、大幅に高い検索精度によりこのモデルに取って代わります。

ベストプラクティス

単一言語またはクロス言語のコードベースでのコード検索、ドキュメント検索、コード再利用に使用してください。8,192 トークンを超えるドキュメントには、関数またはクラスの境界でチャンキングを実装してください。モデルはベクトルデータベース(Qdrant、Weaviate、MongoDB)および RAG フレームワークと統合できます。新規のコード検索プロジェクトでは、jina-code-embeddings-1.5b1.5B パラメータ、32K コンテキスト、SOTA 精度)または jina-code-embeddings-0.5b494M パラメータ、エッジフレンドリー)を推奨します。本番環境では CUDA 対応 GPU を推奨します。Python、JavaScript、Java、PHP、Go、Ruby で最高の性能を発揮し、30 以上の言語を段階的品質低下を伴ってサポートします。

このモデルについて言及しているブログ
4月 08, 2025 • 21 読む時間
jina-reranker-m0:多言語マルチモーダルドキュメントリランカー
視覚的なドキュメントを検索するための新しい多言語・マルチモーダルリランカー jina-reranker-m0 を紹介します。多言語の長文ドキュメントやコード検索タスクにおいて、最先端(SOTA)の性能を実現しています。
9月 27, 2024 • 15 読む時間
Jina Embeddings v2 から v3 への移行
Jina Embeddings v2 から v3 への移行に役立つヒントをいくつか集めました。
4月 29, 2024 • 7 読む時間
Azure 上の Jina Embeddings と Reranker:スケーラブルなビジネス向け AI ソリューション
Jina Embeddings および Rerankers が Azure Marketplace で利用可能になりました。プライバシーとセキュリティを重視する企業は、Jina AI の最先端モデルを既存の Azure エコシステムに簡単に統合できるようになりました。
3月 25, 2024 • 21 読む時間
次世代クラウド AI:Amazon SageMaker 上の Jina Embeddings と Rerankers
Amazon SageMaker と AWS マーケットプレイスで利用可能なコンポーネントのみを使用して、AWS 上のフルスタック AI アプリケーションで Jina Embeddings と Reranking モデルの使用方法を学びましょう。
2月 05, 2024 • 4 読む時間
新しい Jina コード埋め込みであなたのコード検索を強化する
新しい 𝗷𝗶𝗻𝗮-𝗲𝗺𝗯𝗲𝗱𝗱𝗶𝗻𝗴𝘀-𝘃𝟮-𝗯𝗮𝘀𝗲-𝗰𝗼𝗱𝗲 は、コードと docstring の検索に最適化されています。この強力なモデルは、英語と 30 の主要なプログラミング言語間の検索をサポートし、すべて 8192 のコンテキスト長と SOTA のパフォーマンスを備えています。