Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
架构
实验结果
入门指南
结论
star
甄选
新闻稿
八月 03, 2026

jina-reranker-v3.5:基于混合注意力机制与自蒸馏的更高效列表式重排器

一款在 BEIR 基准测试中超越 Qwen3-Reranker-4B 的 0.6B 参数列表式重排器,其重排速度比 v3 快 1.56 倍,并在半结构化检索任务中提升了 9.6 个 nDCG@10 分值。
Jina AI
Jina AI • 11 分钟阅读
jinaai/jina-reranker-v3.5 · Hugging Face
我们致力于通过开源和开放科学来推进并普及人工智能。
jina-reranker-v3.5:一种结合混合注意力与自蒸馏的高效列表式重排器
列表式重排器是智能检索流程的判别核心,但生产环境的部署同时要求模型具备高效性、领域鲁棒性以及对半结构化数据的流畅处理能力。我们推出了 jina-reranker-v3.5,这是一款参数量为 0.6B 的列表式重排器。它在满足上述需求的同时,并没有牺牲其前身 jina-reranker-v3 所具备的跨文档对比能力。jina-reranker-v3.5 保留了 jina-reranker-v3 的“最后但非最晚”(LBNL)交互机制,并从三个维度对其进行了重构。它用由三层滑动窗口层和两层全局层组成的混合调度方案取代了统一的全局注意力机制,并将末端层固定为全局层,以满足 LBNL 读取需求。该模型在涵盖法律、医疗、金融、多语言及结构化检索的精选多领域混合数据上进行训练。我们通过三阶段自蒸馏方案进行质量迁移:首先由全注意力机制教师模型设定上限,再由稀疏注意力机制学生模型在分阶段适配协议下进行恢复。jina-reranker-v3.5 在 BEIR 基准测试中达到 63.20 nDCG@10,以约 1/7 的参数量媲美 4B 模型,并在 MIRACL 和 RTEB 上超越了 jina-reranker-v3。其在半结构化检索任务中表现尤为突出,nDCG@10 较 jina-reranker-v3 提升了 9.6 个点,领先于所有同量级重排器。混合调度方案进一步将列表式推理延迟降低了高达 1.56 倍。我们已在 Hugging Face 上以非商业许可发布了模型权重。
arXiv.orgChristina Nasika

今天我们发布了 jina-reranker-v3.5,这是一款参数量为 0.6B 的列表式重排器。它保留了 jina-reranker-v3 的“最后但非最晚”(last-but-not-late)交互机制,并使其在企业实际搜索的数据上运行得更快、能力更强。它在 BEIR 上达到了 63.20 nDCG@10,参数量仅为 Qwen3-Reranker-4B 的约 1/7,但在性能上却领先于后者;在处理长文档时,其重排速度比 v3 快 1.56 倍。其最大的提升体现在半结构化检索上:在受字段约束的记录中,nDCG@10 较 v3 提升了 +9.6。

这一成果归功于三项改进:一套混合注意力调度机制,用滑动窗口取代了大部分全局层,同时将末端层固定为全局层;一个精心筛选的训练集,汇集了法律、医疗、金融、多语言及结构化检索中的各类失效模式;以及一种三阶段的自蒸馏方法,其中教师模型与学生模型大小相同,仅在注意力模式上有所区别。

以下是四个基准场景下的质量与参数量对比。jina-reranker-v3.5 在所有四个场景中均位于帕累托前沿(Pareto front):在我们评估的所有模型中,没有其他模型能同时做到体积更小且性能更优。

Scatter plot of nDCG@10 against parameter count on BEIR with a Pareto frontier line
基于 13 个数据集的 BEIR 英语零样本检索结果,指标为使用 jina-embeddings-v5-text-small 检索到的前 100 个候选结果进行重排后的 nDCG@10。红线描绘了帕累托前沿,阴影区域表示被支配的区域:对于该区域内的每个模型,总能找到另一个模型比它更小、更好,或两者兼具。jina-reranker-v3.5 以 63.20 的得分直接定义了前沿,超过了 1.5B 参数的 mxbai-rerank-large-v2(62.45)和 4B 参数的 Qwen3-Reranker-4B(62.28)。在我们评估的所有更大模型中,没有一个能在 BEIR 质量上超越它。
Scatter plot of nDCG@10 against parameter count on MIRACL with a Pareto frontier line
基于 18 种语言的 MIRACL 多语言检索,采用相同的前 100 名重排协议。jina-reranker-v3.5 以 74.11 的得分占据了前沿 0.6B 参数的角点,是所有紧凑型模型中的最高分,而 Qwen3-Reranker-4B 则以 76.56 占据了 4B 参数的角点。相较于 jina-reranker-v3,各语言中提升幅度最大的是约鲁巴语(+4.4)、波斯语(+3.1)和法语(+3.0)。
Scatter plot of nDCG@10 against parameter count on RTEB with a Pareto frontier line
RTEB 专业领域检索,涵盖法律、金融、编程和医疗语料库。jina-reranker-v3.5 达到 70.95,超越了同等规模 68.41 分的 Qwen3-Reranker-0.6B 和 70.81 分的 1.5B 参数模型 mxbai-rerank-large-v2。与 77.68 分的 Qwen3-Reranker-4B 之间的差距主要集中在少数法律和医疗任务上。
Scatter plot of nDCG@10 against parameter count on Struct-IR with a Pareto frontier line
Struct-IR 下的半结构化检索,采用受控候选池,其中所有黄金文档与 30 个最难的初级阶段干扰项一同注入,从而将测量重点从检索覆盖率中独立出来,专门衡量对字段约束的判别能力。jina-reranker-v3.5 达到 48.3,较 jina-reranker-v3 提升了 9.6 个点,这是本次发布中单项改进最大的一项。请注意,此协议不可与 SSRB 检索排行榜直接对比。

tag架构

列表式重排需要在单次前向传播中对每个候选文档进行评分,因此对 100 个文档列表进行全自注意力计算会导致计算量呈平方级增长,并导致 KV 缓存膨胀。显而易见的解决方法是滑动窗口注意力。但在 LBNL 交互模式下,这种显而易见的修正方法会破坏模型。

在 LBNL 中,查询(query)和所有候选文档构成一个因果序列,查询的向量模型 token 位于最后。它必须一直回溯到第一个候选文档,才能构建出具有跨文档感知能力的表征。有限的窗口会切断这种依赖关系。因此,我们将末端层始终固定为全局注意力层,这样查询和文档的向量模型 token 在提取时刻就能观测到完整的候选上下文。如果将这一层也替换为滑动窗口,列表式排序的效果会严重下降;仅保留该层为全局层,则在无需全全局堆栈的情况下保留了联合编码能力。

对于其余 27 层,我们搜索了 1L1G、1L2G、3L2G 和 5L1G 等调度方案。最终 3L2G 胜出:即三层滑动窗口层后接两层全局层,循环交替。这提供了 17 层局部和 11 层全局层,窗口大小为 1,024 个词元。局部层将注意力成本从 O(L²) 降低到 O(L·w),而每隔三步的全局层则会在每个深度刷新长距离的跨候选文档信号。更密集的调度方案并未提升吞吐量;而更激进的 5L1G 方案在复杂的多文档任务上表现有下降趋势。

Architecture diagram showing LBNL listwise encoding with a 3L2G hybrid backbone and the three-stage self-distillation pipeline
左图:基于 3L2G 混合 Qwen3-0.6B 主干网络的 LBNL 列表式编码。查询词和所有候选文档共享一个因果上下文;L 层使用 1,024 个词元的滑动窗口,G 层为全局层,终端层 G* 被固定为全局层,以便尾部的查询向量模型能够看到整个列表。MLP 将其投影到共享空间,并通过余弦相似度进行排序。右图:三阶段配方,其中第一阶段的全注意力教师模型保持冻结,并指导第三阶段的学习。

tag跨注意力鸿沟的自蒸馏

这里的蒸馏不同寻常。我们并非将大模型压缩为小模型。教师模型和学生模型均为 0.6B 参数,仅在注意力模式上有所不同。教师模型以二次方成本运行全注意力;学生模型则运行 3L2G。

强迫学生模型同时切换注意力掩码并匹配教师模型的输出会导致两者均失败,因此该配方解耦了这两种压力:

  • 第一阶段 — 全注意力教师模型。 从公开的 jina-reranker-v3 检查点开始,我们在完整的 v3.5 混合数据集上对教师模型进行全量微调,且不限制滑动窗口。它确立了该参数规模下的质量上限。
  • 第二阶段 — 稀疏注意力适配。 学生模型从第一阶段的权重初始化并激活 3L2G。首先,我们仅训练注意力投影层,同时冻结其他所有参数,教导稀疏掩码如何在不干扰全注意力下学习到的表征的情况下路由信息。随后,我们解冻所有参数,使学生模型重新对齐到新的注意力几何结构。此时学生模型已可部署且速度更快,但在 BEIR、RTEB-legal 和 MIRACL 上与教师模型仍存在一致的差距。
  • 第三阶段 — 教师引导的蒸馏。 在保持教师模型冻结的状态下,我们同时在四个层面对学生模型进行对齐:基于 softmax 归一化得分分布的列表式 KL 散度、绝对得分的 MSE(均方误差)、末层隐藏状态的 MSE,以及投影向量模型上的余弦损失,外加上下文内相似度和离散度正则化。

顺序至关重要。仅进行第二阶段会留下明显的差距,因为学生模型必须在较弱的掩码下改变其路由,才能安全地模仿教师模型的得分和状态。第三阶段随后弥补了大部分差距,这表明一旦几何结构适应后,全注意力的能力确实可以迁移到稀疏的学生模型中。该配方是为 3L2G 编写的,但其思路可推广到其他注意力调度不匹配的情况。

tag训练数据

v3 的混合数据很好地涵盖了通用检索,但在特定领域表现不佳。我们没有增加更多数据,而是对 RTEB 和 STARK 开发集进行了错误分析,并构建了新的数据分片,专门覆盖通用模型失效的检索模式。硬负例同时来自多个检索器(BM25、Jina、BGE、GTE、E5、ColBERT),因此模型无法学习单一检索器的捷径。

法律分片结合了 EUR-Lex 多语种数据、CLERC、AILA、加拿大判例法、瑞士案例摘要和 EuroVoc,并进行了过采样,因为法律文本引用密集且篇幅较长。医学分片针对临床用语和实体密集的段落。金融分片优先处理数字声明、监管语言和表格感知段落。多语种覆盖范围在 MIRACL 和 mMARCO 的基础上,增加了 50 多种语言的 WebFAQ、SWIM-IR 跨语言负例以及 Ruri-v3 日语对。

结构化数据获得了最高的采样权重,因为它位于标准基准假设的自由文本分布之外。记录和表格的相关性取决于相等性、数值和日期范围、列表成员身份以及跨字段的逻辑组合,而非词汇重叠。早期运行中这方面的表现最差,因此我们直接合成了包含大量约束条件的样本对。

Pipeline diagram for generating constraint-heavy synthetic training data for structured retrieval
用于字段约束检索的合成监督数据。我们从锚点记录中采样类型化的约束条件,并让大模型将其改写为查询词,然后扰动一个或两个受限字段,构建出外观形式相同但违反约束的近重复硬负例。密集挖掘增加了更多候选对象,大模型判别器提升了真实匹配项,优化了过宽的查询并丢弃了歧义案例,反馈回查询生成过程。右侧示例展示了为何词汇重叠在此处无效:正例和硬负例除了单个字段外完全相同。

tag实验结果

所有数字均为在统一的 MTEB v2 流水线下对 jina-embeddings-v5-text-small 的前 100 个候选结果进行重排所得,因此可能与厂商报告的数字略有不同。完整的每数据集和每语言表格请见论文。

模型参数量BEIRMIRACLRTEBStruct-IR
jina-embeddings-v5-text-small (第一阶段)0.5B56.2665.1564.60–
mxbai-rerank-base-v20.5B59.5864.9061.4430.4
Qwen3-Reranker-0.6B0.6B56.9467.1268.4141.9
mxbai-rerank-large-v21.5B62.4569.6570.8143.0
Qwen3-Reranker-4B4.0B62.2876.5677.6855.6
jina-reranker-v30.6B62.1072.2068.0138.7
<strong>jina-reranker-v3.5</strong>0.6B63.2074.1170.9548.3

在相同的参数规模下,v3.5 在所有基准测试系列中均优于 v3,其中在半结构化检索上的增益最为显著。

RTEB 的提升集中在我们针对的方向:AILA-Statute 比 v3 提升了 14.0 个点,AILA-Case 提升了 11.7 个点,FinQA 达到 86.91,是所有测试模型中表现最好的。在 STARK 上,v3.5 在所有三个官方指标上均优于 v3,并整体获得了最佳的 Hit@5。

关于 Struct-IR 的一项协议说明:该基准测试对每个模式索引了数百万个对象,第一阶段的模式内 Recall@5 约为 0.04,因此端到端的“检索-再重排”过程几乎完全受限于召回率,难以区分重排器的优劣。我们改为在 30 个最难的第一阶段干扰项旁边注入所有金标准文档,从而将字段约束判别与检索覆盖范围隔离开来。在该数据池下的数字与 SSRB 检索排行榜不具备可比性。

tag效率

在单台 NVIDIA A100 上测量,批量大小为 1,输入为前 100 个列表项,使用 FlashAttention-2。

Bar chart comparing mean listwise reranking latency of v3 and v3.5 on BEIR Natural Questions
短上下文环境,BEIR Natural Questions,对 254 个计时查询,查询词和文档的平均长度分别为 10.3 和 145.5 个词元。前 100 个列表式重排的平均延迟从 371 毫秒下降到 305 毫秒,实现了 1.22 倍的加速,文档吞吐量从 270 文档/秒提升至 328 文档/秒。
Bar chart comparing mean listwise reranking latency of v3 and v3.5 on RTEB AILACasedocs
长上下文环境,RTEB AILACasedocs,对 48 个计时查询,查询词和文档的平均长度分别为 689.8 和 1,904.0 个词元。平均延迟从 16.1 秒下降至 10.3 秒,实现了 1.56 倍的加速,预填充(prefill)吞吐量从 11.9k 词元/秒提升至 18.6k 词元/秒。当候选段落较长时,混合注意力机制的收益最为明显。

由于生产环境中的列表式重排主要由针对新鲜候选集的一次预填充所主导,这些延迟的降低直接转化为在固定服务预算下支持更长的候选列表和更大的文档规模。

tag入门指南

tag通过 Jina Search Foundation API

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
  "model": "jina-reranker-v3.5",
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "documents": [
    "...",
    "..."
  ],
  "return_documents": false
}'

tag通过 Elastic Inference Service

jina-reranker-v3.5 已在 Stack 9.3 版本的 Elastic Inference Service (EIS) 中提供,因此您可以在托管 GPU 上进行重排,而无需自行托管模型。创建一个引用该模型的推理端点,然后像调用其他 rerank 任务一样调用它。

PUT _inference/rerank/eis-jina-reranker-v3-5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-reranker-v3.5"
  }
}
POST _inference/rerank/eis-jina-reranker-v3-5
{
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "input": [
    "...",
    "..."
  ]
}

响应会返回一个按相关性排序的 rerank 数组,每个条目包含候选文档的原始索引及其得分。由于这是一个标准的推理端点,inference_id 可以直接在搜索查询中的 text_similarity_reranker 检索器中被引用。

tag通过 transformers 使用

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3.5',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains catechins that may help reduce inflammation.",
    "El precio del cafe ha aumentado un 20% este ano.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
    "Le the vert est riche en antioxydants.",
]

for r in model.rerank(query, documents):
    print(f"{r['relevance_score']:.4f}  {r['document'][:70]}")

tag结论

jina-reranker-v3.5 的实际主张是非常具体且可验证的:在 0.6B 参数规模下,通过针对性训练,它几乎弥补了与 4B 通用型重排器之间的性能差距;在 BEIR 测试集上,它甚至完全消除了这一差距,同时运行速度比所替代的模型更快。对于企业级检索而言,这表明相比于盲目使用最大的可用模型,投资于紧凑型骨干网络上的专注监督训练更具价值。

有两点局限性值得明确指出。列表式重排器(Listwise rerankers)仍然面临点对点(pointwise)模型和后期交互(late-interaction)模型所能规避的输入限制,特别是对候选集数量和候选文本总长度的固定上限。此外,在 RTEB 的法律和医学任务、受控池的 Struct-IR 以及低资源语言的 MIRACL 任务上,该模型与 4B 参数的 Qwen 相比仍存在明显差距。这些是棘手的难题,我们选择将其列出,而不是掩盖在平均值之下。

类别:
star
甄选
新闻稿
rss_feed

阅读更多
五月 12, 2026 • 7 分钟阅读
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
二月 19, 2026 • 7 分钟阅读
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
十二月 04, 2025 • 7 分钟阅读
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。