I/O 图

多个

文档

查询

jina-reranker-v1

排序

帕累托前沿
30M100M300M0.810.820.830.84bge-reranker-basejina-reranker-v1-base-enjina-reranker-v1-tiny-enms-marco-MiniLM-L-4-v2ms-marco-MiniLM-L-6-v2mxbai-rerank-base-v1mxbai-rerank-xsmall-v1jina-reranker-v1-turbo-…参数量(对数)hit-rate
本模型
在前沿上
Jina AI
其他
LlamaIndex RAG · avg3emb
0.835
参数量
38M
按分数的排名
2 / 8
帕累托前沿
在前沿上
取值分布
AUC 0.8287
语料
翻译对
0.4800.000.200.400.600.80
相关29.0%
困难负例7.0%
无关1.1%
推荐阈值
FPR 0.1 · 0.223
FPR 0.01 · 0.480
FPR 0.001 · 0.753
FPR 0.0001 · 0.959
均衡 · 0.083
AUC
0.8287
噪声上限
0.731
召回悬崖
0.019
测量样本对
100 / 9,200
各名次得分
12345678910
各名次位置上的平均得分
选择要比较的模型

概述

jina-reranker-v1-turbo-en 是一个 37.8M 参数的英语 cross-encoder 重排序模型,在将文档处理速度提升 3 倍、内存使用减少 75% 的同时,提供基线模型 95% 的准确率。它面向完整 cross-encoder 的精度-延迟权衡不切实际的生产搜索系统设计,为大规模搜索优化提供一条实用路径。

方法

该模型将基线重排序器的 12 层 BERT 架构压缩为 37.8M 参数(基线为 137M)的 6 层设计。它保留了用于查询与文档间 token 级交互的核心 BERT cross-attention 机制,但通过减少层数和高效的参数分配来优化速度。训练使用知识蒸馏:更大的基线模型作为教师,引导 turbo 变体以更少的参数匹配其排序行为。该模型通过 ALiBi 位置编码支持最多 8,192 token 的序列,在保持快速推理的同时实现全面的文档分析。

性能

在 BEIR 上,turbo 变体取得 NDCG{'@'}10 49.60,保留了基线模型性能(52.45)的 95%,同时优于 bge-reranker-base(47.89,278M 参数)。在 RAG 应用中,它保持 83.51% 的命中率和 0.6498 MRR。速度优势显著:比基线模型快 3 倍,吞吐量随参数减少近乎线性扩展。内存需求从基线的 550MB 降至 turbo 的 150MB,使其能部署在更小的实例上,并在云环境中大幅节省成本。在大多数任务上性能退化极小,在极度细腻的排序场景下得分略低。

最佳实践

实现两阶段流水线:向量搜索提供初始候选,然后该模型对前 100–200 个结果重新排序。大多数应用的最佳平衡点是每个查询重新排序 100–200 个候选,兼顾质量和速度。该模型仅限英语——多语言应用请使用 jina-reranker-v2-base-multilingualjina-reranker-v3.5。它需要支持 CUDA 的硬件,但可在比基线模型更小的实例上运行(GPU 内存 150MB 对比 550MB)。可通过 Jina Reranker API 和 AWS SageMaker 获取。对于新项目,推荐选择 jina-reranker-v3.5(多语言、listwise、131K 上下文)。当延迟是主要约束时,该模型 3 倍的速度优势使其适合实时搜索应用。

提及此模型的博客