

今天我们发布了 jina-reranker-v3.5,这是一款参数量为 0.6B 的列表式重排器。它保留了 jina-reranker-v3 的“最后但非最晚”(last-but-not-late)交互机制,并使其在企业实际搜索的数据上运行得更快、能力更强。它在 BEIR 上达到了 63.20 nDCG@10,参数量仅为 Qwen3-Reranker-4B 的约 1/7,但在性能上却领先于后者;在处理长文档时,其重排速度比 v3 快 1.56 倍。其最大的提升体现在半结构化检索上:在受字段约束的记录中,nDCG@10 较 v3 提升了 +9.6。
这一成果归功于三项改进:一套混合注意力调度机制,用滑动窗口取代了大部分全局层,同时将末端层固定为全局层;一个精心筛选的训练集,汇集了法律、医疗、金融、多语言及结构化检索中的各类失效模式;以及一种三阶段的自蒸馏方法,其中教师模型与学生模型大小相同,仅在注意力模式上有所区别。
以下是四个基准场景下的质量与参数量对比。jina-reranker-v3.5 在所有四个场景中均位于帕累托前沿(Pareto front):在我们评估的所有模型中,没有其他模型能同时做到体积更小且性能更优。

mxbai-rerank-large-v2(62.45)和 4B 参数的 Qwen3-Reranker-4B(62.28)。在我们评估的所有更大模型中,没有一个能在 BEIR 质量上超越它。
Qwen3-Reranker-4B 则以 76.56 占据了 4B 参数的角点。相较于 jina-reranker-v3,各语言中提升幅度最大的是约鲁巴语(+4.4)、波斯语(+3.1)和法语(+3.0)。
Qwen3-Reranker-0.6B 和 70.81 分的 1.5B 参数模型 mxbai-rerank-large-v2。与 77.68 分的 Qwen3-Reranker-4B 之间的差距主要集中在少数法律和医疗任务上。
tag架构
列表式重排需要在单次前向传播中对每个候选文档进行评分,因此对 100 个文档列表进行全自注意力计算会导致计算量呈平方级增长,并导致 KV 缓存膨胀。显而易见的解决方法是滑动窗口注意力。但在 LBNL 交互模式下,这种显而易见的修正方法会破坏模型。
在 LBNL 中,查询(query)和所有候选文档构成一个因果序列,查询的向量模型 token 位于最后。它必须一直回溯到第一个候选文档,才能构建出具有跨文档感知能力的表征。有限的窗口会切断这种依赖关系。因此,我们将末端层始终固定为全局注意力层,这样查询和文档的向量模型 token 在提取时刻就能观测到完整的候选上下文。如果将这一层也替换为滑动窗口,列表式排序的效果会严重下降;仅保留该层为全局层,则在无需全全局堆栈的情况下保留了联合编码能力。
对于其余 27 层,我们搜索了 1L1G、1L2G、3L2G 和 5L1G 等调度方案。最终 3L2G 胜出:即三层滑动窗口层后接两层全局层,循环交替。这提供了 17 层局部和 11 层全局层,窗口大小为 1,024 个词元。局部层将注意力成本从 O(L²) 降低到 O(L·w),而每隔三步的全局层则会在每个深度刷新长距离的跨候选文档信号。更密集的调度方案并未提升吞吐量;而更激进的 5L1G 方案在复杂的多文档任务上表现有下降趋势。

tag跨注意力鸿沟的自蒸馏
这里的蒸馏不同寻常。我们并非将大模型压缩为小模型。教师模型和学生模型均为 0.6B 参数,仅在注意力模式上有所不同。教师模型以二次方成本运行全注意力;学生模型则运行 3L2G。
强迫学生模型同时切换注意力掩码并匹配教师模型的输出会导致两者均失败,因此该配方解耦了这两种压力:
- 第一阶段 — 全注意力教师模型。 从公开的 jina-reranker-v3 检查点开始,我们在完整的 v3.5 混合数据集上对教师模型进行全量微调,且不限制滑动窗口。它确立了该参数规模下的质量上限。
- 第二阶段 — 稀疏注意力适配。 学生模型从第一阶段的权重初始化并激活 3L2G。首先,我们仅训练注意力投影层,同时冻结其他所有参数,教导稀疏掩码如何在不干扰全注意力下学习到的表征的情况下路由信息。随后,我们解冻所有参数,使学生模型重新对齐到新的注意力几何结构。此时学生模型已可部署且速度更快,但在 BEIR、RTEB-legal 和 MIRACL 上与教师模型仍存在一致的差距。
- 第三阶段 — 教师引导的蒸馏。 在保持教师模型冻结的状态下,我们同时在四个层面对学生模型进行对齐:基于 softmax 归一化得分分布的列表式 KL 散度、绝对得分的 MSE(均方误差)、末层隐藏状态的 MSE,以及投影向量模型上的余弦损失,外加上下文内相似度和离散度正则化。
顺序至关重要。仅进行第二阶段会留下明显的差距,因为学生模型必须在较弱的掩码下改变其路由,才能安全地模仿教师模型的得分和状态。第三阶段随后弥补了大部分差距,这表明一旦几何结构适应后,全注意力的能力确实可以迁移到稀疏的学生模型中。该配方是为 3L2G 编写的,但其思路可推广到其他注意力调度不匹配的情况。
tag训练数据
v3 的混合数据很好地涵盖了通用检索,但在特定领域表现不佳。我们没有增加更多数据,而是对 RTEB 和 STARK 开发集进行了错误分析,并构建了新的数据分片,专门覆盖通用模型失效的检索模式。硬负例同时来自多个检索器(BM25、Jina、BGE、GTE、E5、ColBERT),因此模型无法学习单一检索器的捷径。
法律分片结合了 EUR-Lex 多语种数据、CLERC、AILA、加拿大判例法、瑞士案例摘要和 EuroVoc,并进行了过采样,因为法律文本引用密集且篇幅较长。医学分片针对临床用语和实体密集的段落。金融分片优先处理数字声明、监管语言和表格感知段落。多语种覆盖范围在 MIRACL 和 mMARCO 的基础上,增加了 50 多种语言的 WebFAQ、SWIM-IR 跨语言负例以及 Ruri-v3 日语对。
结构化数据获得了最高的采样权重,因为它位于标准基准假设的自由文本分布之外。记录和表格的相关性取决于相等性、数值和日期范围、列表成员身份以及跨字段的逻辑组合,而非词汇重叠。早期运行中这方面的表现最差,因此我们直接合成了包含大量约束条件的样本对。

tag实验结果
所有数字均为在统一的 MTEB v2 流水线下对 jina-embeddings-v5-text-small 的前 100 个候选结果进行重排所得,因此可能与厂商报告的数字略有不同。完整的每数据集和每语言表格请见论文。
| 模型 | 参数量 | BEIR | MIRACL | RTEB | Struct-IR |
|---|---|---|---|---|---|
| jina-embeddings-v5-text-small (第一阶段) | 0.5B | 56.26 | 65.15 | 64.60 | – |
| mxbai-rerank-base-v2 | 0.5B | 59.58 | 64.90 | 61.44 | 30.4 |
| Qwen3-Reranker-0.6B | 0.6B | 56.94 | 67.12 | 68.41 | 41.9 |
| mxbai-rerank-large-v2 | 1.5B | 62.45 | 69.65 | 70.81 | 43.0 |
| Qwen3-Reranker-4B | 4.0B | 62.28 | 76.56 | 77.68 | 55.6 |
| jina-reranker-v3 | 0.6B | 62.10 | 72.20 | 68.01 | 38.7 |
| <strong>jina-reranker-v3.5</strong> | 0.6B | 63.20 | 74.11 | 70.95 | 48.3 |
在相同的参数规模下,v3.5 在所有基准测试系列中均优于 v3,其中在半结构化检索上的增益最为显著。
RTEB 的提升集中在我们针对的方向:AILA-Statute 比 v3 提升了 14.0 个点,AILA-Case 提升了 11.7 个点,FinQA 达到 86.91,是所有测试模型中表现最好的。在 STARK 上,v3.5 在所有三个官方指标上均优于 v3,并整体获得了最佳的 Hit@5。
关于 Struct-IR 的一项协议说明:该基准测试对每个模式索引了数百万个对象,第一阶段的模式内 Recall@5 约为 0.04,因此端到端的“检索-再重排”过程几乎完全受限于召回率,难以区分重排器的优劣。我们改为在 30 个最难的第一阶段干扰项旁边注入所有金标准文档,从而将字段约束判别与检索覆盖范围隔离开来。在该数据池下的数字与 SSRB 检索排行榜不具备可比性。
tag效率
在单台 NVIDIA A100 上测量,批量大小为 1,输入为前 100 个列表项,使用 FlashAttention-2。


由于生产环境中的列表式重排主要由针对新鲜候选集的一次预填充所主导,这些延迟的降低直接转化为在固定服务预算下支持更长的候选列表和更大的文档规模。
tag入门指南
tag通过 Jina Search Foundation API
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-reranker-v3.5",
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"documents": [
"...",
"..."
],
"return_documents": false
}'tag通过 Elastic Inference Service
jina-reranker-v3.5 已在 Stack 9.3 版本的 Elastic Inference Service (EIS) 中提供,因此您可以在托管 GPU 上进行重排,而无需自行托管模型。创建一个引用该模型的推理端点,然后像调用其他 rerank 任务一样调用它。
PUT _inference/rerank/eis-jina-reranker-v3-5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-reranker-v3.5"
}
}POST _inference/rerank/eis-jina-reranker-v3-5
{
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"input": [
"...",
"..."
]
}响应会返回一个按相关性排序的 rerank 数组,每个条目包含候选文档的原始索引及其得分。由于这是一个标准的推理端点,inference_id 可以直接在搜索查询中的 text_similarity_reranker 检索器中被引用。
tag通过 transformers 使用
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3.5',
dtype="auto",
trust_remote_code=True,
)
model.eval()
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains catechins that may help reduce inflammation.",
"El precio del cafe ha aumentado un 20% este ano.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
"Le the vert est riche en antioxydants.",
]
for r in model.rerank(query, documents):
print(f"{r['relevance_score']:.4f} {r['document'][:70]}")tag结论
jina-reranker-v3.5 的实际主张是非常具体且可验证的:在 0.6B 参数规模下,通过针对性训练,它几乎弥补了与 4B 通用型重排器之间的性能差距;在 BEIR 测试集上,它甚至完全消除了这一差距,同时运行速度比所替代的模型更快。对于企业级检索而言,这表明相比于盲目使用最大的可用模型,投资于紧凑型骨干网络上的专注监督训练更具价值。
有两点局限性值得明确指出。列表式重排器(Listwise rerankers)仍然面临点对点(pointwise)模型和后期交互(late-interaction)模型所能规避的输入限制,特别是对候选集数量和候选文本总长度的固定上限。此外,在 RTEB 的法律和医学任务、受控池的 Struct-IR 以及低资源语言的 MIRACL 任务上,该模型与 4B 参数的 Qwen 相比仍存在明显差距。这些是棘手的难题,我们选择将其列出,而不是掩盖在平均值之下。






