概要
jina-reranker-m0 は、ビジョン言語モデルのアーキテクチャに基づく 2.4B パラメータのマルチモーダル多言語リランカーです。複数言語の視覚的ドキュメント(テキスト、図、表、チャート)を処理する最初のリランカーであり、ViDoRe(NDCG-5 91.02)と多言語長文書検索(MLDR)で SOTA の性能を達成しています。モデルはテキスト間、テキストから画像へ、画像からテキストへ、混合モダリティのリランキングをサポートしています。
方法
モデルは decoder-only VLM アーキテクチャ(2.4B パラメータ)で構築されており、DFN CLIP ViT ビジョンエンコーダーと Qwen2 言語デコーダを結合しています。テキストのみを処理する従来のクロスエンコーダーとは異なり、VLM バックボーンはテキスト入力のほか画像入力もネイティブに処理し、視覚的コンテンツを含むドキュメント(スキャンされた PDF、インフォグラフィック、スライドデッキ、埋め込み図を含む表)のリランキングを可能にします。10K トークンのコンテキストウィンドウは、1 画像あたり最大 768 トークン(768×28×28 のパッチとして処理)を受け入れます。訓練は、複数言語のさまざまなドキュメントタイプに対してマルチモーダルなコントラスト目的関数を使用します。decoder-only アーキテクチャはリストワイズリランキングを可能にし、文書重複排除やアテンション機構によるランキングスコアの説明可能性への道を開きます——これらの機能は encoder-only アーキテクチャでは利用できません。
パフォーマンス
テキスト間リランキングでは、モデルは BEIR で NDCG-10 58.95 を記録し、jina-embeddings-v3(55.81)と bge-reranker-v2-m3(56.51)を上回っています。多言語コンテンツでは、MIRACL(18 言語)で NDCG-10 66.75 を達成しています。長文書向けの MLDR ベンチマークでは、13 言語にわたって NDCG-10 59.83 を記録しています。コード検索では CoIR で NDCG-10 63.55 に達しています。モデルは視覚的ドキュメント検索で輝きます:ViDoRe で NDCG-5 91.02、Winoground(視覚言語的構成推論)で平均 43.92。一部のモダリティ組み合わせ(例:画像から画像へ)は、特定の訓練データなしでゼロショットモードでサポートされています。
ベストプラクティス
モデルは Jina API、AWS、Azure、GCP マーケットプレイス、または Hugging Face 経由でローカルに利用可能です。API を使用する場合は、テキスト文字列、base64 画像、または画像 URL を渡してください——新規ユーザーには 10M の無料トークンが付与されます。モデルは最大 10K 入力トークン、1 画像あたり最大 768 トークンをサポートしています。最適な結果のため、モデルはテキスト間、テキストから画像へ、画像からテキストへ、テキストから混合モダリティへのタスクで最もよく動作します;画像から画像へはゼロショットです。decoder-only アーキテクチャは、単純なリランカーのほかに、混合モダリティリランカー、リストワイズリランカー、文書重複排除、アテンションベースのランキング説明可能性を可能にします。文書がテキスト専用リランカーでは処理できない視覚的コンテンツ(スキャンされた PDF、チャート、インフォグラフィック)を含む場合に、このモデルを使用してください。コストを抑えた純粋なテキストリランキングには jina-reranker-v3.5 を使用してください。








