I/O 圖

多個

文件

查詢

jina-reranker-v3

排序

帕累託前緣
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-colbert-v2jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-reranker-v3參數量(對數)nDCG@10
本模型
在前緣上
Jina AI
其他
MIRACL
72.20
參數量
597M
按分數的排名
5 / 17
帕累託前緣
在前緣之後
取值分佈
AUC 0.8396
語料
翻譯對
文件檢索
程式碼
0.020-0.200.000.200.400.60
相關62.2%
困難負例18.2%
無關9.5%
推薦閾值
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
均衡 · -0.008
AUC
0.8396
噪聲上限
0.414
召回懸崖
-0.185
測量樣本對
119 / 2,856
各名次得分
12345678910
各名次位置上的平均得分
誰排在第一位
119 個查詢中有 45% 由正確結果奪得第一
候選集敏感度
在列表中的位置0.161
候選集大小0.088
幹擾項難度0.015
同一樣本對上的最大得分波動
選擇要比較的模型
論文 (1)

概述

jina-reranker-v3 是一個 597M 參數的多語言 listwise 重排序模型,引入了 'last but not late'(LBNL)交互——這是相對於成對 cross-encoder 打分的一次範式轉變。它不是孤立地評估每個查詢-文件對,而是在單個 131K token 上下文視窗內同時處理整個候選文件列表,利用因果注意力捕捉文件間關係。它僅用最接近競品 2.5 分之一的參數量,便實現了 SOTA 的 BEIR 效能(61.94 NDCG{'@'}10)。

方法

核心創新是 LBNL 架構。在標準 cross-encoder 中,每個查詢-文件對獨立打分。在 late-interaction 模型(ColBERT)中,文件單獨編碼並按 token 匹配。LBNL 結合了兩者的優勢:查詢和所有候選文件共享單個因果注意力上下文,使模型能跨文件關注並捕捉成對打分遺漏的相對相關性信號。模型每次前向處理最多 16 個文件(訓練時 1 個正例、15 個負例),每個文件被截斷到固定長度。向量透過 Last-Token-Pooling 從每個文件的最後一個 token 提取,利用因果注意力機制自然地聚合前序上下文的資訊。131K token 上下文視窗透過調整基頻的旋轉位置編碼實現。訓練使用三階段漸進課程,結合 InfoNCE、離散損失(權重 0.45)、雙匹配損失(權重 0.85)和相似度損失的多目標損失。

效能

在 BEIR 上,該模型達到 61.94 NDCG{'@'}10,是評估的所有重排序器中最高的,較 jina-reranker-v2 提升 4.88%。它在多跳檢索(HotpotQA 78.56)和事實驗證(FEVER 93.95)上表現卓越。多語言性能在 18 種語言上 MIRACL 達 66.50,其中阿拉伯語 78.69、泰語 81.06。代碼檢索在 CoIR 上達 63.28。它的參數量僅為 1.5B 的 mxbai-rerank-large 的 2.5 分之一,便超越了後者(61.44),並較同規模的 bge-reranker-v2-m3 提升 5.43%。性能在不同文件順序下相對穩定:隨機(62.54)、降序(61.94)、升序(61.52)——表明穩健的 listwise 打分不受候選順序影響。

最佳實踐

使用帶 system/user/assistant 角色和特殊 token 的結構化提示範本進行向量提取。對於超過 131K 上下文的集合,每次前向最多處理 64 個文件。文件隨機排序或按相關性降序排序時效果最佳(效能差異 <1%)。利用跨文件交互能力處理比較排序任務——模型的 listwise 設計能捕捉成對打分遺漏的候選間關係。對於多語言應用,模型在 18 種語言上提供強大的零樣本遷移。為大型文件集實現批次處理,在批次間保持查詢向量一致。256 維輸出向量支援高效的相似度計算。適合多跳推理和事實驗證任務。生產環境請使用 jina-reranker-v3.5,透過混合注意力實現 1.22–1.56 倍更快的推理。

提及此模型的部落格