I/O 図 1

テキスト

jina-embeddings-v4

タスク

ベクター

I/O 図 2

画像

jina-embeddings-v4

タスク

ベクター

I/O 図 3

複数

ベクター

テキスト

jina-embeddings-v4

タスク

I/O 図 4

複数

ベクター

画像

jina-embeddings-v4

タスク

パレートフロン
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4パラメータ数(対数)nDCG@10
このモデル
フロン上
Jina AI
その他
CoIR
71.59
パラメータ
3.8B
スコア順位
2 / 31
パレートフロン
フロン未満
値の分布
AUC 0.8308
コーパス
翻訳ペア
ドキュメント検索
コード
画像 / バナー
画像 / ロゴ
タスク
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
関連6.7%
ハードネガティブ1.1%
無関連0.8%
推奨しきい値
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
バランス · 0.618
AUC
0.8308
ノイズ上限
0.877
再現率の崖
0.516
測定ペア数
119 / 11k
ベクトル成分
-0.19-0.020.15
σ 0.0221 · 487k 個の値
埋め込みの幾何
02048
次元ごとの平均。カーソルを合わせると範囲を表示
ノイズ下限
0.496
実効次元数
73 / 2048
次元の切り詰め
12825651210242048
text-matching · 要求した次元数ごとのしきい値
言語ペア
de-ruen-deen-koen-zhja-ko
ペア間のしきい値のばらつき:0.069
比較するモデルを選択してください
論文 (2)

概要

jina-embeddings-v4 は 3.8B パラメータのマルチモーダル embeddings モデルで、テキストと画像の表現を単一のアーキテクチャに統合します。単一ベクトル(dense)とマルチベクトル(late-interaction/ColBERT スタイル)の両方の出力モードを独自にサポートし、モデルを切り替えずにインデックス効率と検索精度のトレードオフが可能です。視覚的にリッチな文書検索で SOTA 性能を達成し、表、チャート、図、混合メディア形式をネイティブに処理します。

方法

アーキテクチャは大きなトランスフォーマーエンコーダバックボーンと Qwen2.5-VL ベースのビジョンエンコーダーを組み合わせ、テキスト(最大 32K トークン)と画像(768×28×28 パッチ)を共有アテンションレイヤーで処理します。3 つのタスク固有 LoRA アダプタ(それぞれ 60M パラメータ)はモデルを以下に特化させます:非対称クエリ-文書検索、セマンティックテキスト類似度、コード検索。デュアル出力設計が中核の革新です:モデルは高速な ANN インデックス向けの 2048 次元の単一 dense ベクトル(Matryoshka 切り捨てで 128 次元まで短縮可能)または、late-interaction スコアリング用の 128 次元トークンレベルベクトルのセットを生成できます。訓練は 2 段階のカリキュラムを使用しました:テキスト-画像とテキスト-テキストペアでの joint コントラスティブ事前訓練に続き、タスク固有 LoRA アダプタ訓練です。32K トークンコンテキストウィンドウを超える文書には late chunking がサポートされます。Qwen Research License が適用されます。

パフォーマンス

JinaVDR(Visual Document Retrieval)では、モデルは平均 72.19 を記録し、ColPali-v1.2 の 64.50 に対して上回っています。ViDoRe では平均 84.11(マルチベクトルモードでは 90.17)で、ColPali の 83.90 を上回ります。クロスモーダル検索は CLIP ベンチマークで 84.11 を達成し、jina-clip-v2(81.12)と nllb-clip-large-siglip(83.19)を上回っています。テキスト検索スコア:MTEB-en で 55.97、MMTEB で 66.49、LongEmbed で 67.11(jina-embeddings-v3 は 55.66)。セマンティック類似度は English STS で 85.89、多言語 STS で 72.70。コード検索は CoIR で 71.59。クロスモーダルアラインメントはコサイン類似度 0.71(OpenAI CLIP は 0.15)に達します。マルチベクトルモードは視覚的にリッチなタスクで常にシングルベクトルモードを上回り、シングルベクトルモードは標準的なテキスト検索で効率的な性能を提供します。

ベストプラクティス

パイプラインに基づいて出力モードを選択してください:大規模 ANN インデックスにはシングルベクトル(Matryoshka 切り捨てで 128–512 次元が利用可能)、視覚的にリッチな文書の top-k 候補の再ランキングにはマルチベクトル。API のタスクパラメータで LoRA アダプタを選択します:クエリ-文書検索は 'retrieval'、セマンティック類似度は 'text-matching'、コード検索は 'code'。32K トークンを超える文書には `late_chunking を使用してください。LoRA アダプタごとの 60M パラメータオーバーヘッドは無視できるほど小さく(メモリ増加 <2%)で、3 つすべてのアダプタを同時にロードできます。モデルは Qwen Research License の下でライセンスされています(商用ライセンスなしでの商用利用は不可)。本番デプロイには CUDA 対応 GPU を使用してください;モデルは Jina API、AWS、Azure、GCP マーケットプレイスで利用可能です。テキストのみワークロードには、jina-embeddings-v5-text-small` が計算コストの一小部でパラメータあたりの精度を向上させます。

このモデルについて言及しているブログ