概述
jina-reranker-v2-base-multilingual 是一个 278M 参数的 cross-encoder 重排序模型,支持 100 多种语言,具有 1,024 token 的上下文窗口(使用 Flash Attention 2 时为 524,288 token)。它是打破仅限英语限制的首个 Jina 重排序器,在 AirBench 上取得 SOTA 性能,并在包括函数调用和 SQL 模式匹配在内的结构化数据任务上表现强劲。它处理文档的速度比同类模型快 15 倍。
方法
该模型采用经 Flash Attention 2 增强的 cross-encoder 架构,使查询与文档能跨越语言障碍直接比较。278M 参数的 BERT 编码器对 1,024 token 的基础上下文(使用 Flash Attention 2 可扩展至 524,288 token)使用对称双向注意力和 ALiBi 位置编码。训练遵循四阶段渐进过程:(1) 英语能力,(2) 跨语言对齐,(3) 多语言数据纳入,(4) 困难负样本精炼。这种分阶段方法防止了向单语言模型添加多语言数据时常发生的灾难性遗忘。Flash Attention 2 实现是关键的效率创新,实现了比 bge-reranker-v2-m3 高 15 倍的吞吐量。
性能
该模型在面向 RAG 系统的 AirBench 排行榜上取得 SOTA 性能,并在 MKQA(26 种语言)上表现强劲。它在结构化数据任务上表现卓越:ToolBench(函数调用)上的高召回率和 NSText2SQL(SQL 模式匹配)。最令人印象深刻的是,它比 bge-reranker-v2-m3 等同类模型快 15 倍地处理文档,使其适用于实时应用。100 多种语言支持加上结构化数据能力,使其特别适合智能体 RAG 系统和多语言 API 文档搜索。2026 年,jina-reranker-v3.5 以 listwise 交互、131K 上下文和领域特定训练取代该模型。
最佳实践
该模型需要支持 CUDA 的 GPU,可通过 Jina Reranker API、主要 RAG 框架(Haystack、LangChain)和云市场(AWS、Azure、GCP)访问。它在需要跨越语言障碍和数据类型的精确理解场景中表现出色:处理多语言内容的全球企业、API 文档搜索、多语言代码库中的代码检索。凭借 1,024 token 的上下文窗口和针对较长文档的自动分块,它高效处理扩展内容。当你需要跨语言提升搜索准确率、需要智能体 RAG 的函数调用能力、或想改进多语言代码库的代码搜索时,使用此模型。对于新项目,jina-reranker-v3.5 提供 listwise 排序、131K 上下文和领域特定改进。









