概述
jina-reranker-v1-turbo-en 是一个 37.8M 参数的英语 cross-encoder 重排序模型,在将文档处理速度提升 3 倍、内存使用减少 75% 的同时,提供基线模型 95% 的准确率。它面向完整 cross-encoder 的精度-延迟权衡不切实际的生产搜索系统设计,为大规模搜索优化提供一条实用路径。
方法
该模型将基线重排序器的 12 层 BERT 架构压缩为 37.8M 参数(基线为 137M)的 6 层设计。它保留了用于查询与文档间 token 级交互的核心 BERT cross-attention 机制,但通过减少层数和高效的参数分配来优化速度。训练使用知识蒸馏:更大的基线模型作为教师,引导 turbo 变体以更少的参数匹配其排序行为。该模型通过 ALiBi 位置编码支持最多 8,192 token 的序列,在保持快速推理的同时实现全面的文档分析。
性能
在 BEIR 上,turbo 变体取得 NDCG@10 49.60,保留了基线模型性能(52.45)的 95%,同时优于 bge-reranker-base(47.89,278M 参数)。在 RAG 应用中,它保持 83.51% 的命中率和 0.6498 MRR。速度优势显著:比基线模型快 3 倍,吞吐量随参数减少近乎线性扩展。内存需求从基线的 550MB 降至 turbo 的 150MB,使其能部署在更小的实例上,并在云环境中大幅节省成本。在大多数任务上性能退化极小,在极度细腻的排序场景下得分略低。
最佳实践
实现两阶段流水线:向量搜索提供初始候选,然后该模型对前 100–200 个结果重新排序。大多数应用的最佳平衡点是每个查询重新排序 100–200 个候选,兼顾质量和速度。该模型仅限英语——多语言应用请使用 jina-reranker-v2-base-multilingual 或 jina-reranker-v3.5。它需要支持 CUDA 的硬件,但可在比基线模型更小的实例上运行(GPU 内存 150MB 对比 550MB)。可通过 Jina Reranker API 和 AWS SageMaker 获取。对于新项目,推荐选择 jina-reranker-v3.5(多语言、listwise、131K 上下文)。当延迟是主要约束时,该模型 3 倍的速度优势使其适合实时搜索应用。





