I/O 图

多个

文档

查询

jina-reranker-v3

排序

帕累托前沿
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-colbert-v2jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-reranker-v3参数量(对数)nDCG@10
本模型
在前沿上
Jina AI
其他
MIRACL
72.20
参数量
597M
按分数的排名
5 / 17
帕累托前沿
在前沿之后
取值分布
AUC 0.8396
语料
翻译对
文档检索
代码
0.020-0.200.000.200.400.60
相关62.2%
困难负例18.2%
无关9.5%
推荐阈值
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
均衡 · -0.008
AUC
0.8396
噪声上限
0.414
召回悬崖
-0.185
测量样本对
119 / 2,856
各名次得分
12345678910
各名次位置上的平均得分
谁排在第一位
119 个查询中有 45% 由正确结果夺得第一
候选集敏感度
在列表中的位置0.161
候选集大小0.088
干扰项难度0.015
同一样本对上的最大得分波动
选择要比较的模型
论文 (1)

概述

jina-reranker-v3 是一个 597M 参数的多语言 listwise 重排序模型,引入了 'last but not late'(LBNL)交互——这是相对于成对 cross-encoder 打分的一次范式转变。它不是孤立地评估每个查询-文档对,而是在单个 131K token 上下文窗口内同时处理整个候选文档列表,利用因果注意力捕捉文档间关系。它仅用最接近竞品 2.5 分之一的参数量,便实现了 SOTA 的 BEIR 性能(61.94 NDCG{'@'}10)。

方法

核心创新是 LBNL 架构。在标准 cross-encoder 中,每个查询-文档对独立打分。在 late-interaction 模型(ColBERT)中,文档单独编码并按 token 匹配。LBNL 结合了两者的优势:查询和所有候选文档共享单个因果注意力上下文,使模型能跨文档关注并捕捉成对打分遗漏的相对相关性信号。模型每次前向处理最多 16 个文档(训练时 1 个正例、15 个负例),每个文档被截断到固定长度。向量通过 Last-Token-Pooling 从每个文档的最后一个 token 提取,利用因果注意力机制自然地聚合前序上下文的信息。131K token 上下文窗口通过调整基频的旋转位置编码实现。训练使用三阶段渐进课程,结合 InfoNCE、离散损失(权重 0.45)、双匹配损失(权重 0.85)和相似度损失的多目标损失。

性能

在 BEIR 上,该模型达到 61.94 NDCG{'@'}10,是评估的所有重排序器中最高的,较 jina-reranker-v2 提升 4.88%。它在多跳检索(HotpotQA 78.56)和事实验证(FEVER 93.95)上表现卓越。多语言性能在 18 种语言上 MIRACL 达 66.50,其中阿拉伯语 78.69、泰语 81.06。代码检索在 CoIR 上达 63.28。它的参数量仅为 1.5B 的 mxbai-rerank-large 的 2.5 分之一,便超越了后者(61.44),并较同规模的 bge-reranker-v2-m3 提升 5.43%。性能在不同文档顺序下相对稳定:随机(62.54)、降序(61.94)、升序(61.52)——表明稳健的 listwise 打分不受候选顺序影响。

最佳实践

使用带 system/user/assistant 角色和特殊 token 的结构化提示模板进行向量提取。对于超过 131K 上下文的集合,每次前向最多处理 64 个文档。文档随机排序或按相关性降序排序时效果最佳(性能差异 <1%)。利用跨文档交互能力处理比较排序任务——模型的 listwise 设计能捕捉成对打分遗漏的候选间关系。对于多语言应用,模型在 18 种语言上提供强大的零样本迁移。为大型文档集实现批处理,在批次间保持查询向量一致。256 维输出向量支持高效的相似度计算。适合多跳推理和事实验证任务。生产环境请使用 jina-reranker-v3.5,通过混合注意力实现 1.22–1.56 倍更快的推理。

提及此模型的博客