概述
jina-reranker-v3 是一個 597M 參數的多語言 listwise 重排序模型,引入了 'last but not late'(LBNL)交互——這是相對於成對 cross-encoder 打分的一次範式轉變。它不是孤立地評估每個查詢-文件對,而是在單個 131K token 上下文視窗內同時處理整個候選文件列表,利用因果注意力捕捉文件間關係。它僅用最接近競品 2.5 分之一的參數量,便實現了 SOTA 的 BEIR 效能(61.94 NDCG@10)。
方法
核心創新是 LBNL 架構。在標準 cross-encoder 中,每個查詢-文件對獨立打分。在 late-interaction 模型(ColBERT)中,文件單獨編碼並按 token 匹配。LBNL 結合了兩者的優勢:查詢和所有候選文件共享單個因果注意力上下文,使模型能跨文件關注並捕捉成對打分遺漏的相對相關性信號。模型每次前向處理最多 16 個文件(訓練時 1 個正例、15 個負例),每個文件被截斷到固定長度。向量透過 Last-Token-Pooling 從每個文件的最後一個 token 提取,利用因果注意力機制自然地聚合前序上下文的資訊。131K token 上下文視窗透過調整基頻的旋轉位置編碼實現。訓練使用三階段漸進課程,結合 InfoNCE、離散損失(權重 0.45)、雙匹配損失(權重 0.85)和相似度損失的多目標損失。
效能
在 BEIR 上,該模型達到 61.94 NDCG@10,是評估的所有重排序器中最高的,較 jina-reranker-v2 提升 4.88%。它在多跳檢索(HotpotQA 78.56)和事實驗證(FEVER 93.95)上表現卓越。多語言性能在 18 種語言上 MIRACL 達 66.50,其中阿拉伯語 78.69、泰語 81.06。代碼檢索在 CoIR 上達 63.28。它的參數量僅為 1.5B 的 mxbai-rerank-large 的 2.5 分之一,便超越了後者(61.44),並較同規模的 bge-reranker-v2-m3 提升 5.43%。性能在不同文件順序下相對穩定:隨機(62.54)、降序(61.94)、升序(61.52)——表明穩健的 listwise 打分不受候選順序影響。
最佳實踐
使用帶 system/user/assistant 角色和特殊 token 的結構化提示範本進行向量提取。對於超過 131K 上下文的集合,每次前向最多處理 64 個文件。文件隨機排序或按相關性降序排序時效果最佳(效能差異 <1%)。利用跨文件交互能力處理比較排序任務——模型的 listwise 設計能捕捉成對打分遺漏的候選間關係。對於多語言應用,模型在 18 種語言上提供強大的零樣本遷移。為大型文件集實現批次處理,在批次間保持查詢向量一致。256 維輸出向量支援高效的相似度計算。適合多跳推理和事實驗證任務。生產環境請使用 jina-reranker-v3.5,透過混合注意力實現 1.22–1.56 倍更快的推理。








