概述
jina-reranker-v1-base-en 是一个 137M 参数的英语 cross-encoder 重排序模型,通过查询-文档对的 token 级分析来优化搜索结果。相比基线向量搜索,它将搜索准确率提升了 20%,成为 Jina 第一代重排序器家族的主力。它现已被多语言 v2 和 listwise v3 家族取代。
方法
该模型采用基于 BERT 的 cross-attention 架构(12 层、12 个注意力头、768 隐藏维度、137M 参数),从根本上不同于基于向量的方法。它不比较预先计算的文档向量,而是在查询与文档之间执行动态的 token 级交互,捕捉余弦相似度会遗漏的上下文细微差别。1,024 token 的上下文窗口支持针对较长文档的自动分块和跨块 max-pooling。训练在查询-文档相关性对上使用对比损失,并结合困难负样本挖掘。该模型是第一个 Jina 重排序器,通过知识蒸馏确立了 turbo 和 tiny 变体的模式。
性能
该模型相比基线向量搜索,命中率提升 8%,平均倒数排名提升 33%。在 BEIR 上,它取得平均 NDCG@10 为 0.5588,优于 BGE(0.5032)、BCE(0.4969)和 Cohere(0.5141)。在面向长上下文理解的 LoCo 基准上,它得分 0.873,大幅领先竞争对手。它在技术内容上表现尤为突出:QASPER 摘要上 0.996,政府报告分析上 0.962,但会议摘要任务上表现较低(0.466)。延迟随文档长度增加:256 token 为 156ms,512 token 查询下 4,096 token 为 7,068ms。
最佳实践
实现两阶段流水线:向量搜索(例如 jina-embeddings-v5-text-small)提供初始候选,然后该模型对前 100–200 个结果重新排序以提升精度。该模型仅限英语——多语言应用请使用 jina-reranker-v2-base-multilingual 或 jina-reranker-v3.5。它需要支持 CUDA 的硬件才能达到生产吞吐量。对于新项目,优先选择 jina-reranker-v3.5(多语言、listwise、131K 上下文、63.20 BEIR NDCG@10)。该模型可通过 Jina Reranker API、AWS SageMaker 和 Hugging Face 获取。与 RAG 系统集成时,请根据延迟需求调整发送重新排序的文档数量——100–200 个文档通常能平衡质量和速度。










