Jina AI 再一次展示了其对高质量多语言 AI 模型的承诺,发布了其西班牙语-英语双语模型。
该模型可以为最多 8k token 的西班牙语或英语文本提供嵌入向量。它的设计理念是:如果两种语言的文本表达相同的含义,它们的嵌入向量在几何空间上会很接近。Jina Embeddings v2 的西班牙语和英语版本特别适用于跨语言信息检索、双语语义分析和双语 RAG 应用。
这个新模型 jina-embeddings-v2-base-es 为西班牙语带来了与 Jina AI 的 v2 模型相同的先进性能和突破性功能,涵盖了英语、德语、中文以及编程语言:
- 8,192 token 的输入上下文长度,在开源嵌入模型中处于领先地位。
- 真正的双语支持而非不均衡的多语言支持。Jina AI 的双语模型经过训练,可以为两种语言提供平衡的支持,避免了基于未经整理的互联网数据训练的"多语言"模型的偏差。
- jina-embeddings-v2-base-es 与性能相当的开源模型相比更加紧凑。嵌入向量维度为 768,可以节省生产环境中的空间和运行时间。
- Jina Embeddings v2 模型已完全集成到主要的向量数据库、RAG 框架和 AI 开发库中:
Jina Embeddings v2 的西班牙语和英语版本现在可以通过 Jina Embeddings API 访问,提供一百万个免费 token,让您可以免费试用。

tag基准测试
在西班牙语基准测试中,Jina v2 的西班牙语和英语版本性能超过了Multilingual E5 base 模型和BGE M3 模型,这是目前唯一可比的支持西班牙语的开源模型。以下测试(MTEB-es)改编自大规模文本嵌入基准测试。您可以从这个 GitHub 仓库查看并运行这些测试。

Jina Embeddings 在除分类之外的所有指标上都优于 E5,并且在检索、聚类和跨语言任务中优于 BGE-M3,尽管其大小只有这些更大模型的 15% 到 30%。
- 在检索任务(如在数据库中查找相关文档)和聚类(识别集合中属于同一组的文档)方面表现显著更好
- 在重排序(按语义相似度排序文档)方面与 E5 性能相当,在西班牙语文本分类方面接近
- 三个模型在跨语言任务(为西班牙语输入找到语义相似的英语文本,或反之)的基准测试分数非常接近,但 Jina Embeddings 仍然表现最好
与 OpenAI 和 Cohere 的闭源多语言模型相比,Jina Embeddings 的紧凑体积让其成就更加令人印象深刻。

在西班牙语检索任务中,Jina 的表现优于 OpenAI 和 Cohere 提供的闭源模型,并且在跨语言任务中优于 OpenAI(且几乎达到了 Cohere 的性能水平)。
tagJina Embeddings:面向多语言世界的 AI
西班牙语使用者超过五亿人,在二十多个国家以及欧盟、联合国、世界贸易组织和FIFA等组织中都具有官方语言地位。推出这个专门的双语模型清楚地展示了 Jina AI 将 AI 技术带给每个人的承诺。
除了西班牙语和其高性能的英语单语模型,Jina AI 目前还为德语、中文和编程语言提供最先进的嵌入模型,未来还会推出更多语言的模型。
Jina AI 致力于为最广泛的受众推进 AI 技术发展,高度重视透明度、可访问性、可负担性、隐私和数据保护。
我们重视您对所有模型的反馈。加入我们的社区频道,为开发做出贡献并了解最新进展。







