I/O 图 1

多个

文本

文本

jina-reranker-m0

排序

I/O 图 2

多个

图片

文本

jina-reranker-m0

排序

I/O 图 3

多个

文本

图片

jina-reranker-m0

排序

I/O 图 4

多个

图片

图片

jina-reranker-m0

排序

帕累托前沿
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…参数量(对数)nDCG@5
本模型
在前沿上
Jina AI
其他
ViDoRe v1
91.02
参数量
2.4B
按分数的排名
7 / 24
帕累托前沿
在前沿之后
取值分布
AUC 0.9383
语料
翻译对
文档检索
代码
图片 / 头图
图片 / 标识
0.7120.200.400.600.801.00
相关83.2%
困难负例24.7%
无关9.3%
推荐阈值
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
均衡 · 0.692
AUC
0.9383
噪声上限
0.965
召回悬崖
0.425
测量样本对
119 / 2,856
各名次得分
12345678910
各名次位置上的平均得分
谁排在第一位
119 个查询中有 66% 由正确结果夺得第一
选择要比较的模型

概述

jina-reranker-m0 是一个基于视觉语言模型架构的 2.4B 参数多模态多语言重排序模型。它是首个处理多语言视觉文档(文本、图片、表格、图表)的重排序器,在 ViDoRe(NDCG-5 91.02)和多语言长文档检索(MLDR)上取得 SOTA 性能。该模型支持文本-文本、文本-图像、图像-文本和混合模态的重排序。

方法

该模型基于 decoder-only VLM 架构(2.4B 参数),结合 DFN CLIP ViT 视觉编码器和 Qwen2 语言解码器。与仅处理文本的传统 cross-encoder 不同,VLM 骨干原生处理文本和图像输入,使包含视觉内容(扫描 PDF、信息图、幻灯片、带嵌入图片的表格)的文档可以进行重排序。10K token 上下文窗口可容纳每图像最多 768 个 token(以 768×28×28 的 patch 处理)。训练使用跨多语言、多种文档类型的多模态对比目标。decoder-only 架构使 listwise 重排序成为可能,并为文档去重和基于注意力机制的排序分数可解释性打开可能性——这些是 encoder-only 架构无法提供的能力。

性能

在文本-文本重排序中,该模型在 BEIR 上取得 NDCG-10 58.95,超越了 jina-embeddings-v3(55.81)和 bge-reranker-v2-m3(56.51)。对于多语言内容,它在 MIRACL(18 种语言)上取得 NDCG-10 66.75。在长文档的 MLDR 基准上,它在 13 种语言上取得 NDCG-10 59.83。代码检索在 CoIR 上达到 NDCG-10 63.55。该模型在视觉文档检索中表现出色:ViDoRe 上 NDCG-5 91.02,Winoground(视觉-语言组合推理)上平均 43.92。某些模态组合(如图像-图像)在零样本模式下受支持,无需特定训练数据。

最佳实践

该模型可通过 Jina API、AWS、Azure、GCP 市场或本地通过 Hugging Face 访问。使用 API 时,传递文本字符串、base64 图像或图像 URL——新用户获得 10M 免费 token。该模型支持最多 10K 输入 token,每图像最多 768 个 token。为了最佳效果,该模型在文本-文本、文本-图像、图像-文本和文本-混合模态任务上表现最佳;图像-图像为零样本。decoder-only 架构使简单重排序之外的能力成为可能:混合模态重排序、listwise 重排序、文档去重和基于注意力的排序可解释性。当您的文档包含文本专用重排序器无法处理的视觉内容(扫描 PDF、图表、信息图)时,请使用该模型。为了更低成本的纯文本重排序,请使用 jina-reranker-v3.5。

提及此模型的博客