概述
jina-reranker-v1-tiny-en 是一個 33M 參數的英語 cross-encoder 重排序模型——Jina v1 家族中最小的一個。透過積極的知識蒸餾,它在將文件處理速度提升 5 倍、記憶體使用比 turbo 變體少 13% 的同時,保留了基準模型 92.5% 的準確率。它面向對延遲預算要求嚴格的邊緣計算、移動應用和高吞吐搜尋系統設計。
方法
該模型採用基於 JinaBERT 的精簡四層架構,使用對稱雙向 ALiBi 位置編碼。其開發利用了來自 137M 參數 jina-reranker-v1-base-en 的知識蒸餾,該模型作為教師模型。學生模型無需大量真實訓練資料即可學習最佳排序行為,僅用 33M 參數即可匹配教師的軟排序分佈。四層設計和縮減的隱藏維度實現了對基準模型的 5 倍加速。該模型支援 1,024 token 的上下文,並對較長文件自動分塊。
效能
在 BEIR 上,該模型取得 NDCG@10 48.54,保留了基準模型性能(52.45)的 92.5%,而體積僅為後者的四分之一。在 LlamaIndex RAG 基準上,它在顯著更快處理文件的同時保持 83.16% 的命中率,幾乎與更大的模型相當。吞吐量比基準模型快近 5 倍,記憶體使用比 turbo 變體少 13%。這些指標可與或超過 mxbai-rerank-base-v1(184M)和 bge-reranker-base(278M)等更大的模型。性能-體積的權衡使其特別適合資源受限的部署。
最佳實踐
優先選擇處理速度和資源效率至關重要的場景:邊緣計算、移動應用以及對延遲預算要求嚴格的高吞吐搜尋系統。對於需要絕對最大排序精度的應用,基準模型或 jina-reranker-v3.5 更合適。該模型需要支援 CUDA 的 GPU 才能達到最佳性能,但可在比更大模型更低的硬體上運行。它與主要向量資料庫和 RAG 框架整合,可透過 Jina Reranker API 和 AWS SageMaker 取得。該模型僅限英語;多語言應用請使用 jina-reranker-v2-base-multilingual 或 jina-reranker-v3.5。針對特定領域微調時,請仔細平衡訓練資料品質與模型的精簡架構,以維持性能特性。





