

今天我們發布了 jina-reranker-v3.5,這是一款 0.6B 參數的列表式(listwise)重排器,它保留了 jina-reranker-v3 的「最後但非延遲」(last but not late, LBNL)互動機制,同時在企業實際搜尋的數據上表現得更快且更強大。它在 BEIR 上達到了 63.20 nDCG@10,以大約 7 倍少的參數超越了 Qwen3-Reranker-4B,並且在處理長文件時的重排速度比 v3 快達 1.56 倍。它最大的進步在於半結構化檢索:在欄位約束的記錄上,較 v3 提升了 +9.6 nDCG@10。
我們透過三項改進實現了這一點:採用混合注意力排程,以滑動視窗取代大部分全域層,同時將最終層固定為全域層;使用從法律、醫療、金融、多語言和結構化檢索的失敗案例中精選的訓練組合;以及採用三階段自我蒸餾方案,其中教師模型與學生模型規模相同,僅在注意力模式上有所差異。
在四個基準測試領域中,我們比較了品質與參數規模的關係。jina-reranker-v3.5 在這四項中皆處於帕累托前沿(Pareto front):我們評估的所有模型中,沒有比它更小且效果更好的模型。

mxbai-rerank-large-v2(62.45)和 4B 的 Qwen3-Reranker-4B(62.28)。我們評估的任何更大模型在 BEIR 品質上均未超越它。
Qwen3-Reranker-4B 則以 76.56 佔據 4B 角落。相較於 jina-reranker-v3,各語言中進步幅度最大的是約魯巴語(+4.4)、波斯語(+3.1)和法語(+3.0)。
Qwen3-Reranker-0.6B(68.41)以及 1.5B 的 mxbai-rerank-large-v2(70.81),同時保持在 0.6B 的規模。與 77.68 分的 Qwen3-Reranker-4B 之間剩餘的差距,主要集中在少數法律與醫療任務上。
tag架構
列表式重排會在單次前向傳遞中對所有候選項目進行評分,因此對 100 份文件的列表進行完整的自我注意力機制計算,其開銷會呈現二次方成長,並導致 KV 快取膨脹。最直覺的解決方法是使用滑動視窗注意力。但在 LBNL 互動機制下,這種直覺的解決方案會損壞模型。
在 LBNL 中,查詢(query)和所有候選項目形成一個因果序列,而查詢的嵌入詞元位於最後。它必須追溯到第一個候選項目,才能建立具有跨文件感知能力的表徵。有限的視窗會切斷這種依賴關係。因此,我們始終將最後一層固定為全域層,這樣在提取時,查詢和文件嵌入詞元就能觀察到完整的候選上下文。將該層替換為滑動視窗會嚴重降低列表式排名的表現;僅保留該層為全域層,即可在無需完整全域堆疊的情況下保留聯合編碼能力。
對於剩餘的 27 個層,我們測試了 1L1G、1L2G、3L2G 和 5L1G 等排程。最終 3L2G 勝出:三個滑動視窗層後接兩個全域層,循環往復,總計 17 個局部層和 11 個全域層,視窗大小為 1,024 個詞元。局部層將注意力成本從 降低至 ,而每三步一次的全域層則在每一層深度更新長距離的跨候選項目訊號。更密集的排程無法帶來吞吐量的提升;而更激進的 5L1G 在複雜的多文件任務上表現較差。

tag跨注意力鴻溝的自蒸餾
這裡的蒸餾方法並不尋常。我們並非將大模型壓縮為小模型。教師模型與學生模型皆為 0.6B,僅在注意力模式上有所不同。教師模型以平方級成本運行全注意力(full attention);學生模型則運行 3L2G。
強迫學生模型同時切換注意力遮罩並匹配教師模型的輸出會導致兩者皆失敗,因此該配方將兩種壓力解耦:
- 第一階段 — 全注意力教師模型。 從公開的 jina-reranker-v3 檢查點開始,我們在完整的 v3.5 混合數據上對教師模型進行全量微調,且不限制滑動視窗。這確立了該參數規模下的品質上限。
- 第二階段 — 稀疏注意力適配。 學生模型從第一階段的權重初始化並啟用 3L2G。首先,我們僅訓練注意力投影層而凍結其餘部分,教授稀疏遮罩如何在不干擾全注意力下所學表徵的情況下傳遞資訊。隨後,我們解凍所有參數,讓學生模型重新適應新的注意力幾何結構。此時學生模型已可部署且速度更快,但在 BEIR、RTEB-legal 和 MIRACL 上與教師模型仍存在穩定的差距。
- 第三階段 — 教師指導的蒸餾。 在凍結教師模型的情況下,我們同時在四個層級上對齊學生模型:針對 Softmax 正規化分數分佈的列式 KL 散度、絕對分數的 MSE、最後一層隱藏狀態的 MSE,以及投影向量模型輸出上的餘弦損失,外加上下文內的相似度與離散度正規化。
順序至關重要。僅執行第二階段會留下明顯差距,因為學生模型必須先在較弱的遮罩下改變其路由方式,才能安全地模擬教師模型的分數與狀態。第三階段隨後恢復了大部分差距,這證明了一旦幾何結構適應完成,全注意力模型的容量確實可以轉移給稀疏學生模型。該配方是為 3L2G 編寫的,但其概要可推廣至其他注意力排程不匹配的情況。
tag訓練數據
v3 混合數據集能很好地涵蓋一般檢索,但在特定領域的表現較弱。我們沒有增加更多數據,而是對 RTEB 和 STARK 開發集進行了錯誤分析,並建立每個新的分片(shard),以精確覆蓋一般模型失敗的檢索模式。困難負樣本同時來自多個檢索器(BM25、Jina、BGE、GTE、E5、ColBERT),因此模型無法學習單一檢索器的捷徑。
法律分片結合了 EUR-Lex 多語言數據、CLERC、AILA、加拿大判例法、瑞士案例摘要以及 EuroVoc,並進行了過採樣,因為法律文本引用密集且冗長。醫療分片針對臨床措辭和實體密集的段落。金融分片優先考慮數字主張、監管語言和具備表格感知能力的段落。多語言覆蓋範圍透過 50 多種語言的 WebFAQ、SWIM-IR 跨語言負樣本以及 Ruri-v3 日語對,擴展至 MIRACL 和 mMARCO 之外。
結構化數據獲得了最高的採樣權重,因為它位於標準基準測試所假設的自由文本分佈之外。對記錄和表格的相關性判定取決於等值性、數值與日期範圍、列表成員資格以及跨欄位的邏輯組合,而非詞彙重疊。早期運行的效果在此最差,因此我們直接合成了大量包含約束條件的數據對。

tag實驗結果
所有數字均為在統一的 MTEB v2 流程下對 jina-embeddings-v5-text-small 的前 100 個候選項目進行重排的結果,因此可能與廠商報告的數據略有不同。完整的每個數據集和每種語言的表格請參閱論文。
| 模型 | 參數 | BEIR | MIRACL | RTEB | Struct-IR |
|---|---|---|---|---|---|
| jina-embeddings-v5-text-small (第一階段) | 0.5B | 56.26 | 65.15 | 64.60 | – |
| mxbai-rerank-base-v2 | 0.5B | 59.58 | 64.90 | 61.44 | 30.4 |
| Qwen3-Reranker-0.6B | 0.6B | 56.94 | 67.12 | 68.41 | 41.9 |
| mxbai-rerank-large-v2 | 1.5B | 62.45 | 69.65 | 70.81 | 43.0 |
| Qwen3-Reranker-4B | 4.0B | 62.28 | 76.56 | 77.68 | 55.6 |
| jina-reranker-v3 | 0.6B | 62.10 | 72.20 | 68.01 | 38.7 |
| <strong>jina-reranker-v3.5</strong> | 0.6B | 63.20 | 74.11 | 70.95 | 48.3 |
在相同的參數數量下,v3.5 在所有基準測試系列中均優於 v3,在半結構化檢索方面提升幅度最大。
RTEB 的增長集中在我們目標的混合數據範圍內:AILA-Statute 比 v3 提升了 14.0 分,AILA-Case 提升了 11.7 分,而 FinQA 達到 86.91 分,是所有測試模型中的最高分。在 STARK 上,v3.5 在所有三個官方指標上均優於 v3,並獲得了整體最佳的 Hit@5。
關於 Struct-IR 的一項協議說明。該基準測試為每個架構索引了數百萬個物件,第一階段在架構內的 Recall@5 約為 0.04,因此端到端的「先檢索後重排」幾乎完全受限於召回率,無法很好地評估重排器。我們採取的方式是將所有標準答案文件與 30 個最難的第一階段干擾項一起注入,這將欄位約束辨識與檢索覆蓋範圍隔離開來。在此資料池下的數據無法與 SSRB 檢索排行榜直接比較。
tag效率
於單張 NVIDIA A100 上測量,批次大小(batch size)為 1,前 100 個列式輸入,使用 FlashAttention-2。


由於生產環境中的列式重排主要由針對全新候選集的單次預填充所主導,這些延遲降低直接轉化為在固定服務預算下,可支援更長的候選清單與更大的文件處理量。
tag入門指南
tag透過 Jina Search Foundation API
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-reranker-v3.5",
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"documents": [
"...",
"..."
],
"return_documents": false
}'tag透過 Elastic Inference Service
jina-reranker-v3.5 可透過 Stack 9.3 版本的 Elastic Inference Service (EIS) 使用,因此您可以在託管 GPU 上進行重排,無需自行架設模型。建立一個引用該模型的推理端點,然後像執行任何其他 rerank 任務一樣呼叫它。
PUT _inference/rerank/eis-jina-reranker-v3-5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-reranker-v3.5"
}
}POST _inference/rerank/eis-jina-reranker-v3-5
{
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"input": [
"...",
"..."
]
}回應會傳回一個按相關性排序的 rerank 陣列,每個項目包含候選項目的原始索引及其分數。由於它是標準的推理端點,因此可以在搜尋查詢中的 text_similarity_reranker 檢索器直接引用該 inference_id。
tag透過 transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3.5',
dtype="auto",
trust_remote_code=True,
)
model.eval()
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains catechins that may help reduce inflammation.",
"El precio del cafe ha aumentado un 20% este ano.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
"Le the vert est riche en antioxydants.",
]
for r in model.rerank(query, documents):
print(f"{r['relevance_score']:.4f} {r['document'][:70]}")tag結論
jina-reranker-v3.5 的實際主張明確且可驗證:在僅有 0.6B 參數的情況下,透過針對性訓練,它縮小了與 4B 通用型重排器之間的大部分差距,並且在 BEIR 基準測試中完全弭平了這些差距,同時執行速度還比它所取代的模型更快。對於企業級檢索而言,這主張了應投資於針對緊湊骨幹網絡的專注監督訓練,而非預設使用現有最大的模型。
有兩項限制值得明確提出。列表式(Listwise)重排器仍帶有逐點式(pointwise)與後期互動(late-interaction)模型所能避免的輸入限制,特別是在候選數量與候選總長度上的固定上限。此外,在 RTEB 法律與醫療任務、受控池 Struct-IR 以及資源稀缺的 MIRACL 語言方面,該模型與 4B Qwen 之間仍存在明顯差距。這些都是棘手的案例,我們選擇將其列出,而不是將它們隱藏在平均值之後。






