Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
基准测试
Jina Embeddings:面向多语言世界的 AI
新闻稿
二月 14, 2024

在此说西班牙语:高质量的西班牙语-英语 Embeddings 及 8k 上下文

Jina AI 的新型西班牙语-英语双语 embedding 模型为超过 5 亿西班牙语使用者带来了人工智能的前沿技术。
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Jina AI • 4 分钟阅读

Jina AI 再一次展示了其对高质量多语言 AI 模型的承诺,发布了其西班牙语-英语双语模型。

该模型可以为最多 8k token 的西班牙语或英语文本提供嵌入向量。它的设计理念是:如果两种语言的文本表达相同的含义,它们的嵌入向量在几何空间上会很接近。Jina Embeddings v2 的西班牙语和英语版本特别适用于跨语言信息检索、双语语义分析和双语 RAG 应用。

这个新模型 jina-embeddings-v2-base-es 为西班牙语带来了与 Jina AI 的 v2 模型相同的先进性能和突破性功能,涵盖了英语、德语、中文以及编程语言:

  • 8,192 token 的输入上下文长度,在开源嵌入模型中处于领先地位。
  • 真正的双语支持而非不均衡的多语言支持。Jina AI 的双语模型经过训练,可以为两种语言提供平衡的支持,避免了基于未经整理的互联网数据训练的"多语言"模型的偏差。
  • jina-embeddings-v2-base-es 与性能相当的开源模型相比更加紧凑。嵌入向量维度为 768,可以节省生产环境中的空间和运行时间。
  • Jina Embeddings v2 模型已完全集成到主要的向量数据库、RAG 框架和 AI 开发库中:
    • MongoDB
    • Qdrant
    • Weaviate
    • Haystack
    • LlamaIndex

Jina Embeddings v2 的西班牙语和英语版本现在可以通过 Jina Embeddings API 访问,提供一百万个免费 token,让您可以免费试用。

Embedding API
Start with 1M free tokens. Top-performing, 8192 context length bilingual embeddings for your search and RAG systems.

tag基准测试

在西班牙语基准测试中,Jina v2 的西班牙语和英语版本性能超过了Multilingual E5 base 模型和BGE M3 模型,这是目前唯一可比的支持西班牙语的开源模型。以下测试(MTEB-es)改编自大规模文本嵌入基准测试。您可以从这个 GitHub 仓库查看并运行这些测试。

GitHub - jina-ai/mteb-es: MTEB: Massive Text Embedding Benchmark with Spanish datasets
MTEB: Massive Text Embedding Benchmark with Spanish datasets - jina-ai/mteb-es
GitHubjina-ai
Technical table displaying models, sizes, and performance metrics for cross-language, retrieval, and classification tasks.

Jina Embeddings 在除分类之外的所有指标上都优于 E5,并且在检索、聚类和跨语言任务中优于 BGE-M3,尽管其大小只有这些更大模型的 15% 到 30%。

  • 在检索任务(如在数据库中查找相关文档)和聚类(识别集合中属于同一组的文档)方面表现显著更好
  • 在重排序(按语义相似度排序文档)方面与 E5 性能相当,在西班牙语文本分类方面接近
  • 三个模型在跨语言任务(为西班牙语输入找到语义相似的英语文本,或反之)的基准测试分数非常接近,但 Jina Embeddings 仍然表现最好

与 OpenAI 和 Cohere 的闭源多语言模型相比,Jina Embeddings 的紧凑体积让其成就更加令人印象深刻。

Table comparing machine translation systems with models, vendors, and metrics like Spanish benchmarks and cross-language rera

在西班牙语检索任务中,Jina 的表现优于 OpenAI 和 Cohere 提供的闭源模型,并且在跨语言任务中优于 OpenAI(且几乎达到了 Cohere 的性能水平)。

tagJina Embeddings:面向多语言世界的 AI

西班牙语使用者超过五亿人,在二十多个国家以及欧盟、联合国、世界贸易组织和FIFA等组织中都具有官方语言地位。推出这个专门的双语模型清楚地展示了 Jina AI 将 AI 技术带给每个人的承诺。

除了西班牙语和其高性能的英语单语模型,Jina AI 目前还为德语、中文和编程语言提供最先进的嵌入模型,未来还会推出更多语言的模型。

Jina AI 致力于为最广泛的受众推进 AI 技术发展,高度重视透明度、可访问性、可负担性、隐私和数据保护。

我们重视您对所有模型的反馈。加入我们的社区频道,为开发做出贡献并了解最新进展。

Embedding API
从 100 万个免费 token 开始。为您的搜索和 RAG 系统提供顶级性能、8192 上下文长度的双语嵌入。
类别:
新闻稿
rss_feed

阅读更多
八月 03, 2026 • 11 分钟阅读
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
五月 12, 2026 • 7 分钟阅读
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
二月 19, 2026 • 7 分钟阅读
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。