Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
架構
實驗結果
入門指南
結論
star
甄選
新聞稿
八月 03, 2026

jina-reranker-v3.5:透過混合注意力機制與自我知識蒸餾實現更快速的列表式重排器

一款 0.6B 的列表式重排器(listwise reranker),其在 BEIR 基準測試上的表現超越了 Qwen3-Reranker-4B,重排速度比 v3 快上 1.56 倍,並在半結構化檢索中提升了 9.6 的 nDCG@10。
Jina AI
Jina AI • 11 分鐘閱讀
jinaai/jina-reranker-v3.5 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
Listwise rerankers are the discriminative core of agentic retrieval pipelines, yet production deployment demands efficiency, domain robustness, and fluency on semi-structured data at the same time. We present jina-reranker-v3.5, a 0.6B-parameter listwise reranker that meets these demands together without sacrificing the cross-document comparison that makes its predecessor jina-reranker-v3 effective. jina-reranker-v3.5 keeps the last-but-not-late (LBNL) interaction of jina-reranker-v3 and reworks it along three axes. It replaces uniform global attention with a hybrid schedule of three sliding-window layers followed by two global layers, pinning the terminal layer to global as LBNL readout requires. It trains on a curated multi-domain mixture that spans legal, medical, financial, multilingual, and structured retrieval. It transfers quality through a three-stage self-distillation recipe in which a full-attention teacher sets an upper bound that a sparse-attention student then recovers under a staged adaptation protocol. jina-reranker-v3.5 reaches 63.20 nDCG@10 on BEIR, matching a 4B model at roughly 7x fewer parameters, and improves over jina-reranker-v3 on MIRACL and RTEB as well. Its largest gains come on semi-structured retrieval, where it lifts nDCG@10 by 9.6 points over jina-reranker-v3 and leads all rerankers of comparable size. The hybrid schedule further cuts listwise inference latency by up to 1.56x. We release the model weights on Hugging Face under a non-commercial license.
arXiv.orgChristina Nasika

今天我們發布了 jina-reranker-v3.5,這是一款 0.6B 參數的列表式(listwise)重排器,它保留了 jina-reranker-v3 的「最後但非延遲」(last but not late, LBNL)互動機制,同時在企業實際搜尋的數據上表現得更快且更強大。它在 BEIR 上達到了 63.20 nDCG@10,以大約 7 倍少的參數超越了 Qwen3-Reranker-4B,並且在處理長文件時的重排速度比 v3 快達 1.56 倍。它最大的進步在於半結構化檢索:在欄位約束的記錄上,較 v3 提升了 +9.6 nDCG@10。

我們透過三項改進實現了這一點:採用混合注意力排程,以滑動視窗取代大部分全域層,同時將最終層固定為全域層;使用從法律、醫療、金融、多語言和結構化檢索的失敗案例中精選的訓練組合;以及採用三階段自我蒸餾方案,其中教師模型與學生模型規模相同,僅在注意力模式上有所差異。

在四個基準測試領域中,我們比較了品質與參數規模的關係。jina-reranker-v3.5 在這四項中皆處於帕累托前沿(Pareto front):我們評估的所有模型中,沒有比它更小且效果更好的模型。

Scatter plot of nDCG@10 against parameter count on BEIR with a Pareto frontier line
在 13 個資料集上的 BEIR 英語零樣本檢索,以 jina-embeddings-v5-text-small 重排前 100 名候選後的 nDCG@10 進行衡量。紅線描繪了帕累托前沿,陰影區域為劣勢區:對於該區域內的每個模型,都有另一個模型在規模更小、效果更好或兩者兼具。jina-reranker-v3.5 直接將前沿定義在 63.20,高於 1.5B 的 mxbai-rerank-large-v2(62.45)和 4B 的 Qwen3-Reranker-4B(62.28)。我們評估的任何更大模型在 BEIR 品質上均未超越它。
Scatter plot of nDCG@10 against parameter count on MIRACL with a Pareto frontier line
涵蓋 18 種語言的 MIRACL 多語言檢索,採用相同的 Top-100 重排協議。jina-reranker-v3.5 以 74.11 的分數佔據了前沿的 0.6B 角落,是所有輕量級模型中的最佳得分,而 Qwen3-Reranker-4B 則以 76.56 佔據 4B 角落。相較於 jina-reranker-v3,各語言中進步幅度最大的是約魯巴語(+4.4)、波斯語(+3.1)和法語(+3.0)。
Scatter plot of nDCG@10 against parameter count on RTEB with a Pareto frontier line
涵蓋法律、金融、程式設計與醫學語料庫的 RTEB 專業領域檢索。jina-reranker-v3.5 達到 70.95,超越了同等規模的 Qwen3-Reranker-0.6B(68.41)以及 1.5B 的 mxbai-rerank-large-v2(70.81),同時保持在 0.6B 的規模。與 77.68 分的 Qwen3-Reranker-4B 之間剩餘的差距,主要集中在少數法律與醫療任務上。
Scatter plot of nDCG@10 against parameter count on Struct-IR with a Pareto frontier line
在受控候選池下的 Struct-IR 半結構化檢索,其中所有正確文件與 30 個最難的一階干擾項一同加入,以便測量將「欄位約束辨識」從「檢索覆蓋率」中隔離出來。jina-reranker-v3.5 達到 48.3,較 jina-reranker-v3 提升了 9.6 個點,是本次發布中單項改進幅度最大者。請注意,此協議與 SSRB 檢索排行榜不可直接比較。

tag架構

列表式重排會在單次前向傳遞中對所有候選項目進行評分,因此對 100 份文件的列表進行完整的自我注意力機制計算,其開銷會呈現二次方成長,並導致 KV 快取膨脹。最直覺的解決方法是使用滑動視窗注意力。但在 LBNL 互動機制下,這種直覺的解決方案會損壞模型。

在 LBNL 中,查詢(query)和所有候選項目形成一個因果序列,而查詢的嵌入詞元位於最後。它必須追溯到第一個候選項目,才能建立具有跨文件感知能力的表徵。有限的視窗會切斷這種依賴關係。因此,我們始終將最後一層固定為全域層,這樣在提取時,查詢和文件嵌入詞元就能觀察到完整的候選上下文。將該層替換為滑動視窗會嚴重降低列表式排名的表現;僅保留該層為全域層,即可在無需完整全域堆疊的情況下保留聯合編碼能力。

對於剩餘的 27 個層,我們測試了 1L1G、1L2G、3L2G 和 5L1G 等排程。最終 3L2G 勝出:三個滑動視窗層後接兩個全域層,循環往復,總計 17 個局部層和 11 個全域層,視窗大小為 1,024 個詞元。局部層將注意力成本從 O(L2)O(L^2)O(L2) 降低至 O(L⋅w)O(L·w)O(L⋅w),而每三步一次的全域層則在每一層深度更新長距離的跨候選項目訊號。更密集的排程無法帶來吞吐量的提升;而更激進的 5L1G 在複雜的多文件任務上表現較差。

架構圖顯示了具有 3L2G 混合主幹網路及三階段自蒸餾流程的 LBNL 列式編碼
左圖:基於 3L2G 混合 Qwen3-0.6B 主幹網路的 LBNL 列式編碼。查詢(Query)與所有候選項目共享一個因果上下文;L 層使用 1,024 個詞元的滑動視窗,G 層為全域層,終端層 G* 為固定全域層,以便尾端的查詢向量模型輸出能夠查看整個列表。MLP 將其投影到共享空間,並通過餘弦相似度產生排序。右圖:三階段配方,其中第一階段的全注意力教師模型保持凍結並指導第三階段。

tag跨注意力鴻溝的自蒸餾

這裡的蒸餾方法並不尋常。我們並非將大模型壓縮為小模型。教師模型與學生模型皆為 0.6B,僅在注意力模式上有所不同。教師模型以平方級成本運行全注意力(full attention);學生模型則運行 3L2G。

強迫學生模型同時切換注意力遮罩並匹配教師模型的輸出會導致兩者皆失敗,因此該配方將兩種壓力解耦:

  • 第一階段 — 全注意力教師模型。 從公開的 jina-reranker-v3 檢查點開始,我們在完整的 v3.5 混合數據上對教師模型進行全量微調,且不限制滑動視窗。這確立了該參數規模下的品質上限。
  • 第二階段 — 稀疏注意力適配。 學生模型從第一階段的權重初始化並啟用 3L2G。首先,我們僅訓練注意力投影層而凍結其餘部分,教授稀疏遮罩如何在不干擾全注意力下所學表徵的情況下傳遞資訊。隨後,我們解凍所有參數,讓學生模型重新適應新的注意力幾何結構。此時學生模型已可部署且速度更快,但在 BEIR、RTEB-legal 和 MIRACL 上與教師模型仍存在穩定的差距。
  • 第三階段 — 教師指導的蒸餾。 在凍結教師模型的情況下,我們同時在四個層級上對齊學生模型:針對 Softmax 正規化分數分佈的列式 KL 散度、絕對分數的 MSE、最後一層隱藏狀態的 MSE,以及投影向量模型輸出上的餘弦損失,外加上下文內的相似度與離散度正規化。

順序至關重要。僅執行第二階段會留下明顯差距,因為學生模型必須先在較弱的遮罩下改變其路由方式,才能安全地模擬教師模型的分數與狀態。第三階段隨後恢復了大部分差距,這證明了一旦幾何結構適應完成,全注意力模型的容量確實可以轉移給稀疏學生模型。該配方是為 3L2G 編寫的,但其概要可推廣至其他注意力排程不匹配的情況。

tag訓練數據

v3 混合數據集能很好地涵蓋一般檢索,但在特定領域的表現較弱。我們沒有增加更多數據,而是對 RTEB 和 STARK 開發集進行了錯誤分析,並建立每個新的分片(shard),以精確覆蓋一般模型失敗的檢索模式。困難負樣本同時來自多個檢索器(BM25、Jina、BGE、GTE、E5、ColBERT),因此模型無法學習單一檢索器的捷徑。

法律分片結合了 EUR-Lex 多語言數據、CLERC、AILA、加拿大判例法、瑞士案例摘要以及 EuroVoc,並進行了過採樣,因為法律文本引用密集且冗長。醫療分片針對臨床措辭和實體密集的段落。金融分片優先考慮數字主張、監管語言和具備表格感知能力的段落。多語言覆蓋範圍透過 50 多種語言的 WebFAQ、SWIM-IR 跨語言負樣本以及 Ruri-v3 日語對,擴展至 MIRACL 和 mMARCO 之外。

結構化數據獲得了最高的採樣權重,因為它位於標準基準測試所假設的自由文本分佈之外。對記錄和表格的相關性判定取決於等值性、數值與日期範圍、列表成員資格以及跨欄位的邏輯組合,而非詞彙重疊。早期運行的效果在此最差,因此我們直接合成了大量包含約束條件的數據對。

為結構化檢索生成強約束合成訓練數據的流程圖
針對欄位約束檢索的合成監督。我們從錨點記錄中採樣類型化約束,並讓大模型將其改寫為查詢,然後擾動一個或兩個約束欄位以建立近乎重複的困難負樣本,這些樣本保持相同的表面形式但違反了約束條件。密集挖掘增加了更多候選項目,大模型裁判則提升真實匹配項、改進過於寬泛的查詢並丟棄歧義案例,並回饋至查詢生成中。右側的例子顯示了為什麼詞彙重疊在這裡毫無用處:正樣本與困難負樣本除了單一欄位外,字串完全相同。

tag實驗結果

所有數字均為在統一的 MTEB v2 流程下對 jina-embeddings-v5-text-small 的前 100 個候選項目進行重排的結果,因此可能與廠商報告的數據略有不同。完整的每個數據集和每種語言的表格請參閱論文。

模型參數BEIRMIRACLRTEBStruct-IR
jina-embeddings-v5-text-small (第一階段)0.5B56.2665.1564.60–
mxbai-rerank-base-v20.5B59.5864.9061.4430.4
Qwen3-Reranker-0.6B0.6B56.9467.1268.4141.9
mxbai-rerank-large-v21.5B62.4569.6570.8143.0
Qwen3-Reranker-4B4.0B62.2876.5677.6855.6
jina-reranker-v30.6B62.1072.2068.0138.7
<strong>jina-reranker-v3.5</strong>0.6B63.2074.1170.9548.3

在相同的參數數量下,v3.5 在所有基準測試系列中均優於 v3,在半結構化檢索方面提升幅度最大。

RTEB 的增長集中在我們目標的混合數據範圍內:AILA-Statute 比 v3 提升了 14.0 分,AILA-Case 提升了 11.7 分,而 FinQA 達到 86.91 分,是所有測試模型中的最高分。在 STARK 上,v3.5 在所有三個官方指標上均優於 v3,並獲得了整體最佳的 Hit@5。

關於 Struct-IR 的一項協議說明。該基準測試為每個架構索引了數百萬個物件,第一階段在架構內的 Recall@5 約為 0.04,因此端到端的「先檢索後重排」幾乎完全受限於召回率,無法很好地評估重排器。我們採取的方式是將所有標準答案文件與 30 個最難的第一階段干擾項一起注入,這將欄位約束辨識與檢索覆蓋範圍隔離開來。在此資料池下的數據無法與 SSRB 檢索排行榜直接比較。

tag效率

於單張 NVIDIA A100 上測量,批次大小(batch size)為 1,前 100 個列式輸入,使用 FlashAttention-2。

比較 v3 和 v3.5 在 BEIR Natural Questions 上平均列式重排延遲的長條圖
短上下文環境,BEIR Natural Questions,經 254 次計時查詢,平均查詢與文件長度分別為 10.3 和 145.5 個詞元。前 100 個列式重排的平均延遲從 371 毫秒降至 305 毫秒,速度提升 1.22 倍,文件處理吞吐量從每秒 270 份提升至 328 份。
比較 v3 和 v3.5 在 RTEB AILACasedocs 上平均列式重排延遲的長條圖
長上下文環境,RTEB AILACasedocs,經 48 次計時查詢,平均查詢與文件長度分別為 689.8 和 1,904.0 個詞元。平均延遲從 16.1 秒降至 10.3 秒,速度提升 1.56 倍,預填充(prefill)吞吐量從每秒 11.9k 詞元提升至 18.6k 詞元。當候選段落較長時,混合注意力優勢最為顯著。

由於生產環境中的列式重排主要由針對全新候選集的單次預填充所主導,這些延遲降低直接轉化為在固定服務預算下,可支援更長的候選清單與更大的文件處理量。

tag入門指南

tag透過 Jina Search Foundation API

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
  "model": "jina-reranker-v3.5",
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "documents": [
    "...",
    "..."
  ],
  "return_documents": false
}'

tag透過 Elastic Inference Service

jina-reranker-v3.5 可透過 Stack 9.3 版本的 Elastic Inference Service (EIS) 使用,因此您可以在託管 GPU 上進行重排,無需自行架設模型。建立一個引用該模型的推理端點,然後像執行任何其他 rerank 任務一樣呼叫它。

PUT _inference/rerank/eis-jina-reranker-v3-5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-reranker-v3.5"
  }
}
POST _inference/rerank/eis-jina-reranker-v3-5
{
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "input": [
    "...",
    "..."
  ]
}

回應會傳回一個按相關性排序的 rerank 陣列,每個項目包含候選項目的原始索引及其分數。由於它是標準的推理端點,因此可以在搜尋查詢中的 text_similarity_reranker 檢索器直接引用該 inference_id。

tag透過 transformers

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3.5',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains catechins that may help reduce inflammation.",
    "El precio del cafe ha aumentado un 20% este ano.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
    "Le the vert est riche en antioxydants.",
]

for r in model.rerank(query, documents):
    print(f"{r['relevance_score']:.4f}  {r['document'][:70]}")

tag結論

jina-reranker-v3.5 的實際主張明確且可驗證:在僅有 0.6B 參數的情況下,透過針對性訓練,它縮小了與 4B 通用型重排器之間的大部分差距,並且在 BEIR 基準測試中完全弭平了這些差距,同時執行速度還比它所取代的模型更快。對於企業級檢索而言,這主張了應投資於針對緊湊骨幹網絡的專注監督訓練,而非預設使用現有最大的模型。

有兩項限制值得明確提出。列表式(Listwise)重排器仍帶有逐點式(pointwise)與後期互動(late-interaction)模型所能避免的輸入限制,特別是在候選數量與候選總長度上的固定上限。此外,在 RTEB 法律與醫療任務、受控池 Struct-IR 以及資源稀缺的 MIRACL 語言方面,該模型與 4B Qwen 之間仍存在明顯差距。這些都是棘手的案例,我們選擇將其列出,而不是將它們隱藏在平均值之後。

類別:
star
甄選
新聞稿
rss_feed

閱讀更多
五月 12, 2026 • 7 分鐘閱讀
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
二月 19, 2026 • 7 分鐘閱讀
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
十二月 04, 2025 • 7 分鐘閱讀
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。