I/O 图 1
I/O 图 2
I/O 图 3
I/O 图 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
取值分布help_outlineAUC 0.9383
语料
翻译对
文档检索
代码
图像 / 头图
图像 / 标识
相关83.2%
困难负例24.7%
无关9.3%
推荐阈值
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
均衡 · 0.692
AUC
0.9383
噪声上限
0.965
召回悬崖
0.425
测量样本对
119 / 2,856
各名次得分help_outline
各名次位置上的平均得分
谁排在第一位help_outline
119 个查询中有 66% 由正确结果夺得第一
选择要比较的模型
概述
jina-reranker-m0 是一款突破性的多模态多语言重排模型,用于对多语言视觉文档排序。它的过人之处在于能同时处理查询和视觉信息丰富的文档图像,涵盖含文字、图形、表格及各类版式的页面,支持 29 种语言,并按与查询的相关性输出排序后的文档列表。以往的重排模型受困于「模态鸿沟」问题,图像只与图像靠近、文本只与文本靠近,而 jina-reranker-m0 在单个纯解码器模型中统一了文本与视觉模态,能把图像和文本文档放在一起有效排序,带来顺畅的多模态搜索体验。
方法
jina-reranker-m0 的架构与以往方案有本质区别。它基于 24 亿参数的 Qwen2-VL-2B 构建,从经典的交叉编码器架构转向纯解码器的视觉语言模型。该方案沿用 Qwen2-VL 预训练好的视觉编码器和投影器,用 LoRA(低秩自适应)微调其大语言模型,并接一个后训练的 MLP 输出排序 logits,用于衡量查询与文档的相关性。这一判别式模型最多可处理 32K 词元,支持从 56×56 像素到 4K 分辨率的图像。处理图像时,视觉 Transformer(ViT)和投影器会把相邻的 2×2 词元合并为一个视觉词元,特殊词元则清晰标出视觉词元的边界,让语言模型能够统一整合视觉与文本信息并进行推理。
性能
Jina-reranker-m0 在多项基准测试中成绩亮眼。文本到文本重排方面,BEIR 上取得 58.95 NDCG-10,优于 jina-embeddings-v3(55.81)和 bge-reranker-v2-m3(56.51)等对手。多语言内容方面,覆盖 18 种语言的 MIRACL 上取得 66.75 NDCG-10。长文档方面,覆盖 13 种语言的 MLDR 上取得 59.83 NDCG-10。代码检索方面,CoIR 上取得 63.55 NDCG-10,大幅领先同类。而它真正的高光在视觉文档检索:ViDoRe 上取得 91.02 NDCG-5;在考察图文组合推理的 Winoground 上取得 43.92 的平均分,说明它在理解图文关系上明显强于其他模型。
最佳实践
要把 jina-reranker-m0 的潜力发挥到极致,开发者可参考以下几点。该模型可通过 API、云服务市场(AWS、Azure、GCP)调用,也可从 Hugging Face 下载本地部署。使用 API 时,可传入文本字符串、base64 图像或图像 URL,新用户可获赠一千万免费词元。得益于充分的训练,它在文本到文本、文本到图像、图像到文本以及文本到混合单模态等任务上表现优异;不过要注意,图像到图像等组合属于零样本支持,未做专门训练。为获得最佳效果,请记住模型最多支持 10K 输入词元,每张图像最多占 768 词元。纯解码器架构还带来了重排之外的更多可能:真正的混合模态重排、列表式重排、文档去重,以及借助注意力机制解释排序得分,这些都是此前纯编码器架构做不到的。
提及此模型的博客








