I/O 图 1
I/O 图 2
取值分布help_outlineAUC 0.9726
语料
翻译对
代码
相关81.0%
困难负例10.3%
无关0.8%
悬停或点击图表可移动阈值
推荐阈值
FPR 0.1 · 17.83
FPR 0.01 · 19.14
FPR 0.001 · 21.08
FPR 0.0001 · 23.67
均衡 · 18.66
AUC
0.9726
噪声上限
21.05
召回悬崖
16.22
测量样本对
100 / 9,200
各名次得分help_outline
各名次位置上的平均得分
选择要比较的模型
论文 (1)
概述
Jina-ColBERT-v2 是一款突破性的多语言信息检索模型,解决了跨语言高效、高质量检索的核心难题。作为首个能生成紧凑向量的多语言 ColBERT 类模型,它满足了全球化应用对可扩展、高性价比多语言检索方案的迫切需求。从电商平台到内容管理系统,处理多语言内容的企业都可借助该模型获得覆盖 89 种语言的精准检索结果,同时凭借创新的降维能力显著降低存储与计算成本。
方法
该模型以 ColBERT 架构为基础,引入精巧的迟交互机制,从根本上改变了查询与文档的匹配方式。其核心是改造过的 XLM-RoBERTa 主干网络,含 5.6 亿参数,辅以旋转位置编码,并用 FlashAttention 做优化。训练分两个关键阶段:先用多语言的弱监督数据做预训练,再用带标注的三元组数据做微调和监督蒸馏。这套方案的独到之处在于引入了 Matryoshka 表示学习,一次训练即可产出 128、96 或 64 等多种维度的向量,无需重新训练就能动态优化存储开销。
性能
在实际测试中,Jina-ColBERT-v2 于多项基准上展现出卓越能力。英语任务比原版 ColBERT-v2 提升 6.5%,14 项 BEIR 基准的平均分为 0.521。更难得的是,在 MIRACL 基准的所有受测语言上,它都优于传统的 BM25 检索方法,跨语言场景中的优势尤为明显。即便降低向量维度,性能依然稳固:从 128 维降到 64 维,性能仅下降 1.5%,存储需求却减半。这在生产环境中意味着可观的成本节省,例如在 AWS 上存储 1 亿篇文档,64 维向量每月费用为 659.62 美元,128 维则需 1,319.24 美元。
最佳实践
部署 Jina-ColBERT-v2 时,请留意以下几个实际问题。要获得最佳性能,模型需要支持 CUDA 的硬件;文档长度最高支持 8,192 词元(可扩展至 12,288),查询则限制在 32 词元以内。生产部署可通过 Jina Search Foundation API、AWS 市场和 Azure 获取,非商业版本可在 Hugging Face 上取用。接入时请明确当前向量化的是查询还是文档,因为模型采用非对称编码。它并非为在没有索引的情况下实时处理超大文档集合而设计;多语言检索虽是它的强项,但面对特定垂直领域的任务,表现可能略逊于针对该领域微调过的模型。
提及此模型的博客









