Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 许可证
open_in_new 发布博客

jina-embeddings-v2-base-es

支持西英双语的 8K 最佳向量模型
许可证
Apache-2.0
发布日期
calendar_month
2024-02-14
输入
abc
文本
arrow_forward
输出
more_horiz
向量
迟分 help_outline
check_circle
Yes
模型详情
参数: 161M
输入词元长度: 8K
输出维度: 768
底座模型 help_outline
open_in_new
jina-embeddings-v2-base-en
已训练语言 help_outline
2 种语言
相关模型
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
可通过以下方式获取
Jina API
AWS SageMaker
微软云
Hugging Face
物理隔离
I/O 图

文本

jina-embeddings-v2-base-es

向量

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
取值分布help_outline
AUC 0.8383
语料
翻译对
文档检索
0.6830.000.200.400.600.80
相关17.6%
困难负例3.0%
无关0.8%
推荐阈值
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
均衡 · 0.365
AUC
0.8383
噪声上限
0.774
召回悬崖
0.163
测量样本对
119 / 11k
向量分量help_outline
-0.160.000.17
σ 0.0361 · 183k 个数值
嵌入几何help_outline
0768
各维度均值,悬停查看区间
噪声下限
0.326
有效维度
51 / 768
语言对help_outline
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.315
选择要比较的模型
论文 (1)
arXiv
二月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

概述

Jina Embeddings v2 Base Spanish 是一款突破性的双语文本向量模型,解决了西班牙语与英语内容之间跨语言检索与分析的核心难题。传统多语言模型往往偏向某一种语言,而该模型在西班牙语和英语上的表现真正做到了均衡,对于深耕西语市场或处理双语内容的团队不可或缺。它最亮眼的特点是能生成几何对齐的向量:当西班牙语和英语文本表达同一含义时,二者的向量会自然聚集在向量空间的同一区域,跨语言检索与分析由此变得顺畅无碍。

方法

该模型的核心是基于对称双向 ALiBi(线性偏置注意力)的创新架构,无需传统位置编码即可处理长达 8,192 词元的序列。模型采用改造后的 BERT 架构,含 1.61 亿参数,引入门控线性单元(GLU)和专门的层归一化技术。训练分三个阶段:先在海量文本语料上预训练,再用精心挑选的文本对微调,最后用难负样本训练,强化对语义相近但实际不同的内容的辨别力。这套方法配合 768 维向量,让模型既能捕捉细微的语义关联,又保持了计算效率。

性能

在综合基准评测中,该模型表现出色,跨语言检索任务尤为突出:体积只有 E5、BGE-M3 等大型多语言模型的 15% 至 30%,成绩却更胜一筹。它在检索和聚类任务上表现优异,尤其擅长跨语言匹配语义等价的内容。在 MTEB 基准上,它在分类、聚类和语义相似度等各类任务中都发挥稳健。8,192 词元的超长上下文窗口在长文档处理中价值突出,即便文档长达数页,表现依然稳定,而这是大多数竞品所不具备的。

最佳实践

要用好该模型,请确保具备支持 CUDA 的 GPU 环境以发挥最佳性能。它可与 MongoDB、Qdrant、Weaviate、Haystack 等主流向量数据库和 RAG 框架无缝集成,很容易部署到生产环境。该模型在双语文档检索、内容推荐和跨语言文档分析等场景中表现出色。它虽然用途广泛,但主要针对西班牙语-英语的双语场景优化,用于单语应用或其他语言对时未必是最佳选择。为获得最佳效果,输入文本应规整地使用西班牙语或英语,不过它也能很好地处理混合语言内容。模型支持针对垂直领域做微调,但请事先仔细评估训练数据的质量与分布。
提及此模型的博客
四月 29, 2024 • 7 分钟阅读
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
二月 14, 2024 • 4 分钟阅读
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。