I/O 图

文本

jina-embeddings-v2-base-es

向量

帕累托前沿
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…参数量(对数)Spearman
本模型
在前沿上
Jina AI
其他
MTEB English · sts
83.50
参数量
161M
按分数的排名
11 / 39
帕累托前沿
在前沿上
取值分布
AUC 0.8383
语料
翻译对
文档检索
0.6830.000.200.400.600.80
相关17.6%
困难负例3.0%
无关0.8%
推荐阈值
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
均衡 · 0.365
AUC
0.8383
噪声上限
0.774
召回悬崖
0.163
测量样本对
119 / 11k
向量分量
-0.160.000.17
σ 0.0361 · 183k 个数值
向量几何
0768
各维度均值,悬停查看区间
噪声下限
0.326
有效维度
51 / 768
语言对
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.315
选择要比较的模型
论文 (1)

概述

jina-embeddings-v2-base-es 是一个 161M 参数的西英双语文本向量模型,具有 8,192 token 的上下文窗口和 768 维输出。它面向西班牙语市场的跨语言检索而设计,将语义等价的西语英语内容映射到共享的向量空间。该模型解决了一个关键缺口:当时大多数向量模型以英语为中心,西语性能显著下降。

方法

该模型使用带有对称双向 ALiBi 位置编码的 BERT 骨干、161M 参数和 768 维输出空间。训练遵循三阶段流程:(1) 西英平行语料库上的预训练,(2) 精选句对上的含困难负样本挖掘的对比微调,(3) 确保同一概念的西语英语表示聚集在一起的跨语言对齐。ALiBi 机制在不使用学习位置编码的情况下实现了 8,192 token 的上下文,使模型能外推超过其 512 token 训练长度。平均池化产生最终的向量。

性能

该模型在西班牙英语检索任务上显著超过更大的多语言模型(E5、BGE-M3),而仅为其大小的 15–30%。它在 MTEB 西语子任务上表现出色,尤其在检索和聚类方面。8,192 token 的上下文窗口在多页文档上提供了稳定的性能,而大多数竞争模型需要分块。2026 年,jina-embeddings-v5-text-small 取代该模型,提供 89 种语言、32K 上下文和任务特定 LoRA 适配器。v2-base-es 模型仍是专用西英流水线的经济实惠选择。

最佳实践

非常适合西英双语搜索、内容推荐和跨语言文档分析。对于超过 8,192 token 的文档,使用语义分块或通过 Jina API 的 `late_chunking 参数。该模型可与主要向量数据库和 RAG 框架集成。对于需要西英之外多语言覆盖、32K 上下文或任务特定优化的新项目,请优先使用 jina-embeddings-v5-text-small`。生产环境建议使用支持 CUDA 的 GPU。输入文本应为西班牙语或英语;支持混合语言输入,但性能针对两种训练语言优化。

提及此模型的博客