I/O 图

文本

jina-embeddings-v2-base-zh

向量

帕累托前沿
30M100M300M1B3.0B10B506070acge_text_embeddingbge-base-zhbge-base-zh-v1.5bge-large-zh-noinstructbge-small-zhbge-small-zh-v1.5Conan-embedding-v1Dmeta-embedding-zh-smalle5-mistral-7b-instructgte-base-zhgte-large-zhgte-multilingual-basegte-Qwen1.5-7B-instructgte-Qwen2-1.5B-instructgte-Qwen2-7B-instructgte-small-zhluotuo-bert-mediumm3e-basem3e-largemultilingual-e5-basemultilingual-e5-largemultilingual-e5-smallpiccolo-base-zhpiccolo-large-zh-v2stella-base-zh-v2stella-base-zh-v3-1792dstella-large-zh-v2stella-mrl-large-zh-v3.…text2vec-base-chinesetext2vec-large-chinesexiaobu-embeddingxiaobu-embedding-v2Yinkazpoint_large_embedding_…参数量(对数)score
本模型
在前沿上
Jina AI
其他
C-MTEB
63.79
参数量
161M
按分数的排名
23 / 40
帕累托前沿
在前沿之后
取值分布
AUC 0.8373
语料
翻译对
文档检索
0.6820.000.200.400.600.80
相关12.6%
困难负例1.8%
无关1.2%
推荐阈值
FPR 0.1 · 0.475
FPR 0.01 · 0.682
FPR 0.001 · 0.796
FPR 0.0001 · 0.835
均衡 · 0.353
AUC
0.8373
噪声上限
0.793
召回悬崖
0.113
测量样本对
119 / 11k
向量分量
-0.180.000.18
σ 0.0361 · 183k 个数值
向量几何
0768
各维度均值,悬停查看区间
噪声下限
0.308
有效维度
56 / 768
选择要比较的模型
论文 (1)

概述

jina-embeddings-v2-base-zh 是一个 161M 参数的中英双语文本向量模型,具有 8,192 token 的上下文窗口和 768 维输出。它是首个以长上下文支持无缝处理中英文的开源模型,解决了 Transformer 架构中基于字符的中文文本的独特分词挑战。

方法

该模型使用带有对称双向 ALiBi 位置编码的 BERT 骨干、161M 参数和 768 维输出空间。训练遵循三阶段方法:先在高质量中英双语数据上初始预训练,随后进行含对比损失和困难负样本挖掘的主、次微调阶段。ALiBi 机制在不使用学习位置编码的情况下实现了 8,192 token 的上下文窗口。最终发布的一个显著改进是改进的相似度分数分布,它解决了预览版中的分数膨胀问题,产生更具判别性且校准良好的相似度分数。

性能

在 C-MTEB(中文 MTEB)排行榜上,该模型在 0.5GB 以下的模型中表现出卓越性能,尤其在中文任务上。它在中文特定的检索和相似度任务上大幅超过 OpenAI 的 text-embedding-ada-002,同时在英语任务上保持有竞争力的性能。改进的相似度分数分布提高了两种语言中相关与不相关内容之间的判别。2026 年,jina-embeddings-v5-text-small 以 89 种语言、32K 上下文和任务特定 LoRA 适配器取代该模型。

最佳实践

中英双语检索、跨语言文档搜索和多语言内容分析的最佳选择。对于超过 8,192 token 的文档,使用语义分块或通过 Jina API 的 `late_chunking 参数。该模型可与主要向量数据库和 RAG 框架集成。对于新的多语言项目,请优先使用 jina-embeddings-v5-text-small`(89 种语言、32K 上下文、LoRA 适配器)。生产吞吐量建议使用支持 CUDA 的 GPU。输入文本应为中文或英文;该模型无需翻译即可原生处理两种语言。

提及此模型的博客