I/O 图
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
BEIR
63.20
Parameters
597M
Rank by score
1 / 21
Pareto front
On it
取值分布help_outlineAUC 0.9596
语料
翻译对
文档检索
代码
相关89.1%
困难负例23.7%
无关10.9%
推荐阈值
FPR 0.1 · 0.107
FPR 0.01 · 0.438
FPR 0.001 · 0.635
FPR 0.0001 · 0.690
均衡 · 0.070
AUC
0.9596
噪声上限
0.621
召回悬崖
-0.039
测量样本对
119 / 2,856
各名次得分help_outline
各名次位置上的平均得分
谁排在第一位help_outline
119 个查询中有 66% 由正确结果夺得第一
候选集敏感度help_outline
在列表中的位置0.185
候选集大小0.057
干扰项难度0.034
同一样本对上的最大得分波动
选择要比较的模型
论文 (1)
概述
jina-reranker-v3.5 是一款 6 亿参数的多语言列表式文档重排模型,可直接替换升级 jina-reranker-v3。它沿用相同的「后置而不迟」(LBNL)列表式接口,一次前向传播即可让查询对众多候选完成排序,同时在领域鲁棒性、结构化数据排序、多语言检索和推理效率上都有提升。模型基于 Qwen3-0.6B 构建,采用 28 层混合 3L2G 注意力(窗口为 1024 的滑动窗口层,与全局注意力层交错,并按 LBNL 要求固定末层为全局注意力层),配以轻量 MLP 投影器(1024→512→512),支持最长 131K 词元的上下文,通过因果自注意力和余弦打分对文档联合排序。它在 BEIR 上达到 63.20 nDCG-10,超过 4B 的 Qwen3-Reranker,参数量却约为其七分之一;从短上下文到长上下文,运行速度达到 v3 的 1.22 至 1.56 倍。
方法
jina-reranker-v3.5 保留了 jina-reranker-v3 的「后置而不迟」(LBNL)列表式设计:查询与候选共享同一个上下文窗口,并从每篇文档的最后一个词元读取上下文向量。不同之处在于,它用混合 3L2G 方案取代了统一的全局注意力:每组层内,窗口为 1024 的滑动窗口注意力层与全局注意力层交错排列,并按 LBNL 的要求固定末层为全局注意力层。这样既降低了长候选列表上的注意力开销,又保留了跨文档交互。模型通过自蒸馏训练,以获得跨领域稳健的检索能力,其 MLP 投影头输出 512 维向量(1024→512→512)。
性能
在以 jina-embeddings-v5-text-small 作为第一阶段的统一 top-100 评测协议下,jina-reranker-v3.5 在 BEIR、MIRACL、RTEB 和 Struct-IR 上分别取得 63.20 nDCG-10、74.11、70.95 和 48.3,各项均优于 jina-reranker-v3(62.10 / 72.20 / 68.01 / 38.7)。其 BEIR 成绩以约七分之一的参数量小幅超过 4B 的 Qwen3-Reranker(62.28),在所有参评的 0.6B 级重排模型中位居第一。相较 v3 的提升包括:BEIR 提高 1.10 分,MIRACL 提高 2.6%,RTEB 提高 4.3%(法律检索提升尤为明显),结构化数据排序(Struct-IR)提高 24.8%。从短上下文到长上下文,列表式推理速度达到 v3 的 1.22 至 1.56 倍(A100,FlashAttention-2)。
最佳实践
jina-reranker-v3.5 可直接替换 jina-reranker-v3:请求格式完全不变,只需把模型名从 jina-reranker-v3 改为 jina-reranker-v3.5。它一次调用即可让查询对整个候选列表完成排序,通过标准重排端点传入文档,用 top_n 限制返回条数,或设置 return_embeddings 一并取回文档向量。该模型在结构化数据排序、法律等垂直领域检索以及多语言集合上表现尤为出色,混合注意力设计还能在长候选列表下保持低延迟。模型已在 Hugging Face 上以 CC-BY-NC-4.0 协议发布;如需商用请联系我们。
提及此模型的博客



