I/O 图
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
取值分布help_outlineAUC 0.8383
语料
翻译对
文档检索
相关17.6%
困难负例3.0%
无关0.8%
推荐阈值
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
均衡 · 0.365
AUC
0.8383
噪声上限
0.774
召回悬崖
0.163
测量样本对
119 / 11k
向量分量help_outline
σ 0.0361 · 183k 个数值
嵌入几何help_outline
各维度均值,悬停查看区间
噪声下限
0.326
有效维度
51 / 768
语言对help_outline
各语言对之间的阈值跨度:0.315
选择要比较的模型
论文 (1)
概述
Jina Embeddings v2 Base Spanish 是一款突破性的双语文本向量模型,解决了西班牙语与英语内容之间跨语言检索与分析的核心难题。传统多语言模型往往偏向某一种语言,而该模型在西班牙语和英语上的表现真正做到了均衡,对于深耕西语市场或处理双语内容的团队不可或缺。它最亮眼的特点是能生成几何对齐的向量:当西班牙语和英语文本表达同一含义时,二者的向量会自然聚集在向量空间的同一区域,跨语言检索与分析由此变得顺畅无碍。
方法
该模型的核心是基于对称双向 ALiBi(线性偏置注意力)的创新架构,无需传统位置编码即可处理长达 8,192 词元的序列。模型采用改造后的 BERT 架构,含 1.61 亿参数,引入门控线性单元(GLU)和专门的层归一化技术。训练分三个阶段:先在海量文本语料上预训练,再用精心挑选的文本对微调,最后用难负样本训练,强化对语义相近但实际不同的内容的辨别力。这套方法配合 768 维向量,让模型既能捕捉细微的语义关联,又保持了计算效率。
性能
在综合基准评测中,该模型表现出色,跨语言检索任务尤为突出:体积只有 E5、BGE-M3 等大型多语言模型的 15% 至 30%,成绩却更胜一筹。它在检索和聚类任务上表现优异,尤其擅长跨语言匹配语义等价的内容。在 MTEB 基准上,它在分类、聚类和语义相似度等各类任务中都发挥稳健。8,192 词元的超长上下文窗口在长文档处理中价值突出,即便文档长达数页,表现依然稳定,而这是大多数竞品所不具备的。
最佳实践
要用好该模型,请确保具备支持 CUDA 的 GPU 环境以发挥最佳性能。它可与 MongoDB、Qdrant、Weaviate、Haystack 等主流向量数据库和 RAG 框架无缝集成,很容易部署到生产环境。该模型在双语文档检索、内容推荐和跨语言文档分析等场景中表现出色。它虽然用途广泛,但主要针对西班牙语-英语的双语场景优化,用于单语应用或其他语言对时未必是最佳选择。为获得最佳效果,输入文本应规整地使用西班牙语或英语,不过它也能很好地处理混合语言内容。模型支持针对垂直领域做微调,但请事先仔细评估训练数据的质量与分布。
提及此模型的博客




