I/O 图
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
BEIR
62.10
Parameters
597M
Rank by score
4 / 21
Pareto front
Behind it
取值分布help_outlineAUC 0.8396
语料
翻译对
文档检索
代码
相关62.2%
困难负例18.2%
无关9.5%
推荐阈值
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
均衡 · -0.008
AUC
0.8396
噪声上限
0.414
召回悬崖
-0.185
测量样本对
119 / 2,856
各名次得分help_outline
各名次位置上的平均得分
谁排在第一位help_outline
119 个查询中有 45% 由正确结果夺得第一
候选集敏感度help_outline
在列表中的位置0.161
候选集大小0.088
干扰项难度0.015
同一样本对上的最大得分波动
选择要比较的模型
论文 (1)
概述
jina-reranker-v3 是一款 6 亿参数的多语言文档重排模型,首创「后置而不迟」(last but not late)交互架构。ColBERT 需要分别编码再做多向量匹配,而该模型在同一上下文窗口内对查询和文档做因果自注意力,先充分完成跨文档交互,再从每篇文档的最后一个词元提取上下文向量。模型基于 Qwen3-0.6B 构建,含 28 层 Transformer 和一个轻量 MLP 投影器(1024→512→256),可在 131K 词元的上下文中同时处理多达 64 篇文档。它在 BEIR 上取得 61.94 的 nDCG-10,达到业界领先水平,体量却只有生成式列表重排模型的十分之一。
方法
采用三阶段渐进式训练,多目标损失结合 InfoNCE、分散损失(0.45)、对偶匹配损失(0.85)和相似度损失(0.85)。第一阶段用 LoRA 微调(r=16,α=32),在 BGE-M3、Cornstack 等领域数据集上训练,每个查询配 16 篇文档。第二阶段将上下文扩展到 8,192 词元,并跨多个检索系统挖掘难负样本,每个查询最多 25 个负样本,τ=0.05。第三阶段以 0.25 至 0.65 的权重合并各专用模型。特殊词元 doc_emb 和 query_emb 用于标记向量提取位置。训练使用带 system/user/assistant 角色的结构化提示,并把查询同时放在开头和结尾,以形成双向注意力。
性能
在 BEIR 上取得 61.94 的 nDCG-10,在所有参评重排模型中最高,比 jina-reranker-v2 提升 4.88%。多跳检索表现出色,HotpotQA 达 78.56;事实核查方面,FEVER 达 93.95。多语言方面,覆盖 18 种语言的 MIRACL 达 66.50,其中阿拉伯语 78.69、泰语 81.06。代码检索在 CoIR 上达 63.28。参数量仅为 1.5B 的 mxbai-rerank-large(61.44)的五分之二,成绩却更胜一筹,并比同规模的 bge-reranker-v2-m3 高出 5.43%。面对不同的文档排列顺序表现稳定:随机 62.54,降序 61.94,升序 61.52。
最佳实践
请使用带 system/user/assistant 角色和特殊词元的结构化提示模板来提取向量。候选集超出 131K 上下文时,每次前向传播最多处理 64 篇文档。文档随机排序或按相关性降序排列时效果最佳。做对比排序任务时,可充分利用其跨文档交互能力。多语言场景下,模型在 18 种语言间具备出色的零样本迁移能力。文档量大时请采用批处理,并在各批次间保持查询向量一致。相似度计算可考虑直接使用 256 维输出向量以提升效率。该模型非常适合既看重排序质量又要求推理效率的场景,尤其是多跳推理和事实核查任务。
提及此模型的博客








