概述
jina-reranker-m0 是一個基於視覺語言模型架構的 2.4B 參數多模態多語言重排序模型。它是首個處理多語言視覺文件(文本、圖片、表格、圖表)的重排序器,在 ViDoRe(NDCG-5 91.02)和多語言長文件檢索(MLDR)上取得 SOTA 效能。該模型支援文本-文本、文本-圖像、圖像-文本和混合模態的重排序。
方法
該模型基於 decoder-only VLM 架構(2.4B 參數),結合 DFN CLIP ViT 視覺編碼器和 Qwen2 語言解碼器。與僅處理文本的傳統 cross-encoder 不同,VLM 骨幹原生處理文本和圖像輸入,使包含視覺內容(掃描 PDF、資訊圖、投影片、帶嵌入圖片的表格)的文件可以進行重排序。10K token 上下文視窗可容納每圖像最多 768 個 token(以 768×28×28 的 patch 處理)。訓練使用跨多語言、多種文件類型的多模態對比目標。decoder-only 架構使 listwise 重排序成為可能,並為文件去重和基於注意力機制的排序分數可解釋性打開可能性——這些是 encoder-only 架構無法提供的能力。
效能
在文本-文本重排序中,該模型在 BEIR 上取得 NDCG-10 58.95,超越了 jina-embeddings-v3(55.81)和 bge-reranker-v2-m3(56.51)。對於多語言內容,它在 MIRACL(18 種語言)上取得 NDCG-10 66.75。在長文件的 MLDR 基準上,它在 13 種語言上取得 NDCG-10 59.83。程式碼檢索在 CoIR 上達到 NDCG-10 63.55。該模型在視覺文件檢索中表現出色:ViDoRe 上 NDCG-5 91.02,Winoground(視覺-語言組合推理)上平均 43.92。某些模態組合(如圖像-圖像)在零樣本模式下受支援,無需特定訓練資料。
最佳實踐
該模型可透過 Jina API、AWS、Azure、GCP 市場或本地透過 Hugging Face 存取。使用 API 時,傳遞文字字串、base64 圖像或圖像 URL——新用戶獲得 10M 免費 token。該模型支援最多 10K 輸入 token,每圖像最多 768 個 token。為了最佳效果,該模型在文本-文本、文本-圖像、圖像-文本和文本-混合模態任務上表現最佳;圖像-圖像為零樣本。decoder-only 架構使簡單重排序之外的能力成為可能:混合模態重排序、listwise 重排序、文件去重和基於注意力的排序可解釋性。當您的文件包含文本專用重排序器無法處理的視覺內容(掃描 PDF、圖表、資訊圖)時,請使用該模型。為了更低成本的純文本重排序,請使用 jina-reranker-v3.5。








