概述
jina-reranker-v1-turbo-en 是一個 37.8M 參數的英語 cross-encoder 重排序模型,在將文件處理速度提升 3 倍、記憶體使用減少 75% 的同時,提供基準模型 95% 的準確率。它面向完整 cross-encoder 的精度-延遲權衡不切實際的生產搜尋系統設計,為大規模搜尋優化提供一條實用路徑。
方法
該模型將基準重排序器的 12 層 BERT 架構壓縮為 37.8M 參數(基準為 137M)的 6 層設計。它保留了用於查詢與文件間 token 級交互的核心 BERT cross-attention 機制,但透過減少層數和高效的參數分配來最佳化速度。訓練使用知識蒸餾:更大的基準模型作為教師,引導 turbo 變體以更少的參數匹配其排序行為。該模型透過 ALiBi 位置編碼支援最多 8,192 token 的序列,在保持快速推論的同時實現全面的文件分析。
效能
在 BEIR 上,turbo 變體取得 NDCG@10 49.60,保留了基準模型性能(52.45)的 95%,同時優於 bge-reranker-base(47.89,278M 參數)。在 RAG 應用中,它保持 83.51% 的命中率和 0.6498 MRR。速度優勢顯著:比基準模型快 3 倍,吞吐量隨參數減少近乎線性擴展。記憶體需求從基準的 550MB 降至 turbo 的 150MB,使其能部署在更小的執行個體上,並在雲端環境中大幅節省成本。在大多數任務上性能退化極小,在極度細膩的排序場景下得分略低。
最佳實踐
實現兩階段流水線:向量搜尋提供初始候選,然後該模型對前 100–200 個結果重新排序。大多數應用的最佳平衡點是每個查詢重新排序 100–200 個候選,兼顧品質和速度。該模型僅限英語——多語言應用請使用 jina-reranker-v2-base-multilingual 或 jina-reranker-v3.5。它需要支援 CUDA 的硬體,但可在比基準模型更小的執行個體上運行(GPU 記憶體 150MB 對比 550MB)。可透過 Jina Reranker API 和 AWS SageMaker 取得。對於新專案,推薦選擇 jina-reranker-v3.5(多語言、listwise、131K 上下文)。當延遲是主要約束時,該模型 3 倍的速度優勢使其適合即時搜尋應用。





