概述
jina-embeddings-v2-base-zh 是一个 161M 参数的中英双语文本向量模型,具有 8,192 token 的上下文窗口和 768 维输出。它是首个以长上下文支持无缝处理中英文的开源模型,解决了 Transformer 架构中基于字符的中文文本的独特分词挑战。
方法
该模型使用带有对称双向 ALiBi 位置编码的 BERT 骨干、161M 参数和 768 维输出空间。训练遵循三阶段方法:先在高质量中英双语数据上初始预训练,随后进行含对比损失和困难负样本挖掘的主、次微调阶段。ALiBi 机制在不使用学习位置编码的情况下实现了 8,192 token 的上下文窗口。最终发布的一个显著改进是改进的相似度分数分布,它解决了预览版中的分数膨胀问题,产生更具判别性且校准良好的相似度分数。
性能
在 C-MTEB(中文 MTEB)排行榜上,该模型在 0.5GB 以下的模型中表现出卓越性能,尤其在中文任务上。它在中文特定的检索和相似度任务上大幅超过 OpenAI 的 text-embedding-ada-002,同时在英语任务上保持有竞争力的性能。改进的相似度分数分布提高了两种语言中相关与不相关内容之间的判别。2026 年,jina-embeddings-v5-text-small 以 89 种语言、32K 上下文和任务特定 LoRA 适配器取代该模型。
最佳实践
中英双语检索、跨语言文档搜索和多语言内容分析的最佳选择。对于超过 8,192 token 的文档,使用语义分块或通过 Jina API 的 `late_chunking 参数。该模型可与主要向量数据库和 RAG 框架集成。对于新的多语言项目,请优先使用 jina-embeddings-v5-text-small`(89 种语言、32K 上下文、LoRA 适配器)。生产吞吐量建议使用支持 CUDA 的 GPU。输入文本应为中文或英文;该模型无需翻译即可原生处理两种语言。







