Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 许可证
open_in_new 发布博客

jina-embeddings-v2-base-es

支持西英双语的 8K 最佳向量模型
许可证
Apache-2.0
发布日期
calendar_month
2024-02-14
输入
abc
文本
arrow_forward
输出
more_horiz
向量
延迟分块 help_outline
check_circle
Yes
模型详情
参数: 161M
输入词元长度: 8K
输出维度: 768
底座模型 help_outline
jina-bert-v2-base-es
已训练语言 help_outline
2 种语言
相关模型
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
可通过以下方式获取
Jina API
AWS SageMaker
微软云
Hugging Face
物理隔离
I/O 图

文本

jina-embeddings-v2-base-es

向量

帕累托前沿 help_outline
workspace_premium
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…参数量(对数)Spearman
本模型
在前沿上
Jina AI
其他
MTEB English · sts
83.50
参数量
161M
按分数的排名
11 / 39
帕累托前沿
在前沿上
取值分布help_outline
AUC 0.8383
语料
翻译对
文档检索
0.6830.000.200.400.600.80
相关17.6%
困难负例3.0%
无关0.8%
推荐阈值
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
均衡 · 0.365
AUC
0.8383
噪声上限
0.774
召回悬崖
0.163
测量样本对
119 / 11k
向量分量help_outline
-0.160.000.17
σ 0.0361 · 183k 个数值
向量几何help_outline
0768
各维度均值,悬停查看区间
噪声下限
0.326
有效维度
51 / 768
语言对help_outline
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.315
选择要比较的模型
论文 (1)
arXiv
二月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

概述

jina-embeddings-v2-base-es 是一个 161M 参数的西英双语文本向量模型,具有 8,192 token 的上下文窗口和 768 维输出。它面向西班牙语市场的跨语言检索而设计,将语义等价的西语英语内容映射到共享的向量空间。该模型解决了一个关键缺口:当时大多数向量模型以英语为中心,西语性能显著下降。

方法

该模型使用带有对称双向 ALiBi 位置编码的 BERT 骨干、161M 参数和 768 维输出空间。训练遵循三阶段流程:(1) 西英平行语料库上的预训练,(2) 精选句对上的含困难负样本挖掘的对比微调,(3) 确保同一概念的西语英语表示聚集在一起的跨语言对齐。ALiBi 机制在不使用学习位置编码的情况下实现了 8,192 token 的上下文,使模型能外推超过其 512 token 训练长度。平均池化产生最终的向量。

性能

该模型在西班牙英语检索任务上显著超过更大的多语言模型(E5、BGE-M3),而仅为其大小的 15–30%。它在 MTEB 西语子任务上表现出色,尤其在检索和聚类方面。8,192 token 的上下文窗口在多页文档上提供了稳定的性能,而大多数竞争模型需要分块。2026 年,jina-embeddings-v5-text-small 取代该模型,提供 89 种语言、32K 上下文和任务特定 LoRA 适配器。v2-base-es 模型仍是专用西英流水线的经济实惠选择。

最佳实践

非常适合西英双语搜索、内容推荐和跨语言文档分析。对于超过 8,192 token 的文档,使用语义分块或通过 Jina API 的 `late_chunking 参数。该模型可与主要向量数据库和 RAG 框架集成。对于需要西英之外多语言覆盖、32K 上下文或任务特定优化的新项目,请优先使用 jina-embeddings-v5-text-small`。生产环境建议使用支持 CUDA 的 GPU。输入文本应为西班牙语或英语;支持混合语言输入,但性能针对两种训练语言优化。

提及此模型的博客
四月 29, 2024 • 7 分钟阅读
Jina Embeddings 和 Reranker 在 Azure 上:可扩展的企业级 AI 解决方案
Jina Embeddings 和 Rerankers 现已在 Azure Marketplace 上线。重视隐私和安全的企业现在可以在其现有的 Azure 生态系统中轻松集成 Jina AI 的最先进模型。
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
二月 14, 2024 • 4 分钟阅读
在此说西班牙语:高质量的西班牙语-英语 Embeddings 及 8k 上下文
Jina AI 的新型西班牙语-英语双语 embedding 模型为超过 5 亿西班牙语使用者带来了人工智能的前沿技术。
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 标志
open_in_new
下载 Elastic 标志
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业使用,不面向消费者。