I/O 圖 1

多個

文字

文字

jina-reranker-m0

排序

I/O 圖 2

多個

圖片

文字

jina-reranker-m0

排序

I/O 圖 3

多個

文字

圖片

jina-reranker-m0

排序

I/O 圖 4

多個

圖片

圖片

jina-reranker-m0

排序

帕累託前緣
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…參數量(對數)nDCG@5
本模型
在前緣上
Jina AI
其他
ViDoRe v1
91.02
參數量
2.4B
按分數的排名
7 / 24
帕累託前緣
在前緣之後
取值分佈
AUC 0.9383
語料
翻譯對
文件檢索
程式碼
圖片 / 頭圖
圖片 / 標識
0.7120.200.400.600.801.00
相關83.2%
困難負例24.7%
無關9.3%
推薦閾值
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
均衡 · 0.692
AUC
0.9383
噪聲上限
0.965
召回懸崖
0.425
測量樣本對
119 / 2,856
各名次得分
12345678910
各名次位置上的平均得分
誰排在第一位
119 個查詢中有 66% 由正確結果奪得第一
選擇要比較的模型

概述

jina-reranker-m0 是一個基於視覺語言模型架構的 2.4B 參數多模態多語言重排序模型。它是首個處理多語言視覺文件(文本、圖片、表格、圖表)的重排序器,在 ViDoRe(NDCG-5 91.02)和多語言長文件檢索(MLDR)上取得 SOTA 效能。該模型支援文本-文本、文本-圖像、圖像-文本和混合模態的重排序。

方法

該模型基於 decoder-only VLM 架構(2.4B 參數),結合 DFN CLIP ViT 視覺編碼器和 Qwen2 語言解碼器。與僅處理文本的傳統 cross-encoder 不同,VLM 骨幹原生處理文本和圖像輸入,使包含視覺內容(掃描 PDF、資訊圖、投影片、帶嵌入圖片的表格)的文件可以進行重排序。10K token 上下文視窗可容納每圖像最多 768 個 token(以 768×28×28 的 patch 處理)。訓練使用跨多語言、多種文件類型的多模態對比目標。decoder-only 架構使 listwise 重排序成為可能,並為文件去重和基於注意力機制的排序分數可解釋性打開可能性——這些是 encoder-only 架構無法提供的能力。

效能

在文本-文本重排序中,該模型在 BEIR 上取得 NDCG-10 58.95,超越了 jina-embeddings-v3(55.81)和 bge-reranker-v2-m3(56.51)。對於多語言內容,它在 MIRACL(18 種語言)上取得 NDCG-10 66.75。在長文件的 MLDR 基準上,它在 13 種語言上取得 NDCG-10 59.83。程式碼檢索在 CoIR 上達到 NDCG-10 63.55。該模型在視覺文件檢索中表現出色:ViDoRe 上 NDCG-5 91.02,Winoground(視覺-語言組合推理)上平均 43.92。某些模態組合(如圖像-圖像)在零樣本模式下受支援,無需特定訓練資料。

最佳實踐

該模型可透過 Jina API、AWS、Azure、GCP 市場或本地透過 Hugging Face 存取。使用 API 時,傳遞文字字串、base64 圖像或圖像 URL——新用戶獲得 10M 免費 token。該模型支援最多 10K 輸入 token,每圖像最多 768 個 token。為了最佳效果,該模型在文本-文本、文本-圖像、圖像-文本和文本-混合模態任務上表現最佳;圖像-圖像為零樣本。decoder-only 架構使簡單重排序之外的能力成為可能:混合模態重排序、listwise 重排序、文件去重和基於注意力的排序可解釋性。當您的文件包含文本專用重排序器無法處理的視覺內容(掃描 PDF、圖表、資訊圖)時,請使用該模型。為了更低成本的純文本重排序,請使用 jina-reranker-v3.5。

提及此模型的部落格