概述
jina-reranker-m0 是一个基于视觉语言模型架构的 2.4B 参数多模态多语言重排序模型。它是首个处理多语言视觉文档(文本、图片、表格、图表)的重排序器,在 ViDoRe(NDCG-5 91.02)和多语言长文档检索(MLDR)上取得 SOTA 性能。该模型支持文本-文本、文本-图像、图像-文本和混合模态的重排序。
方法
该模型基于 decoder-only VLM 架构(2.4B 参数),结合 DFN CLIP ViT 视觉编码器和 Qwen2 语言解码器。与仅处理文本的传统 cross-encoder 不同,VLM 骨干原生处理文本和图像输入,使包含视觉内容(扫描 PDF、信息图、幻灯片、带嵌入图片的表格)的文档可以进行重排序。10K token 上下文窗口可容纳每图像最多 768 个 token(以 768×28×28 的 patch 处理)。训练使用跨多语言、多种文档类型的多模态对比目标。decoder-only 架构使 listwise 重排序成为可能,并为文档去重和基于注意力机制的排序分数可解释性打开可能性——这些是 encoder-only 架构无法提供的能力。
性能
在文本-文本重排序中,该模型在 BEIR 上取得 NDCG-10 58.95,超越了 jina-embeddings-v3(55.81)和 bge-reranker-v2-m3(56.51)。对于多语言内容,它在 MIRACL(18 种语言)上取得 NDCG-10 66.75。在长文档的 MLDR 基准上,它在 13 种语言上取得 NDCG-10 59.83。代码检索在 CoIR 上达到 NDCG-10 63.55。该模型在视觉文档检索中表现出色:ViDoRe 上 NDCG-5 91.02,Winoground(视觉-语言组合推理)上平均 43.92。某些模态组合(如图像-图像)在零样本模式下受支持,无需特定训练数据。
最佳实践
该模型可通过 Jina API、AWS、Azure、GCP 市场或本地通过 Hugging Face 访问。使用 API 时,传递文本字符串、base64 图像或图像 URL——新用户获得 10M 免费 token。该模型支持最多 10K 输入 token,每图像最多 768 个 token。为了最佳效果,该模型在文本-文本、文本-图像、图像-文本和文本-混合模态任务上表现最佳;图像-图像为零样本。decoder-only 架构使简单重排序之外的能力成为可能:混合模态重排序、listwise 重排序、文档去重和基于注意力的排序可解释性。当您的文档包含文本专用重排序器无法处理的视觉内容(扫描 PDF、图表、信息图)时,请使用该模型。为了更低成本的纯文本重排序,请使用 jina-reranker-v3.5。








