Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 許可證
open_in_new 釋出部落格

jina-embeddings-v2-base-es

支援西英雙語的 8K 最佳向量模型
許可證
Apache-2.0
釋出日期
calendar_month
2024-02-14
輸入
abc
文字
arrow_forward
輸出
more_horiz
向量
遲分 help_outline
check_circle
Yes
模型詳情
引數: 161M
輸入詞元長度: 8K
輸出維度: 768
底座模型 help_outline
open_in_new
jina-embeddings-v2-base-en
已訓練語言 help_outline
2 種語言
相關模型
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
可透過以下方式獲取
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
物理隔離
I/O 圖

文字

jina-embeddings-v2-base-es

向量

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
取值分佈help_outline
AUC 0.8383
語料
翻譯對
文件檢索
0.6830.000.200.400.600.80
相關17.6%
困難負例3.0%
無關0.8%
推薦閾值
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
均衡 · 0.365
AUC
0.8383
噪聲上限
0.774
召回懸崖
0.163
測量樣本對
119 / 11k
向量分量help_outline
-0.160.000.17
σ 0.0361 · 183k 個數值
嵌入幾何help_outline
0768
各維度均值,懸停檢視區間
噪聲下限
0.326
有效維度
51 / 768
語言對help_outline
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.315
選擇要比較的模型
論文 (1)
arXiv
二月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

概述

Jina Embeddings v2 Base Spanish 是一款突破性的雙語文字向量模型,解決了西班牙語與英語內容之間跨語言檢索與分析的核心難題。傳統多語言模型往往偏向某一種語言,而該模型在西班牙語和英語上的表現真正做到了均衡,對於深耕西語市場或處理雙語內容的團隊不可或缺。它最亮眼的特點是能生成幾何對齊的向量:當西班牙語和英語文字表達同一含義時,二者的向量會自然聚集在向量空間的同一區域,跨語言檢索與分析由此變得順暢無礙。

方法

該模型的核心是基於對稱雙向 ALiBi(線性偏置注意力)的創新架構,無需傳統位置編碼即可處理長達 8,192 詞元的序列。模型採用改造後的 BERT 架構,含 1.61 億引數,引入門控線性單元(GLU)和專門的層歸一化技術。訓練分三個階段:先在海量文字語料上預訓練,再用精心挑選的文字對微調,最後用難負樣本訓練,強化對語義相近但實際不同的內容的辨別力。這套方法配合 768 維向量,讓模型既能捕捉細微的語義關聯,又保持了計算效率。

效能

在綜合基準評測中,該模型表現出色,跨語言檢索任務尤為突出:體積只有 E5、BGE-M3 等大型多語言模型的 15% 至 30%,成績卻更勝一籌。它在檢索和聚類任務上表現優異,尤其擅長跨語言匹配語義等價的內容。在 MTEB 基準上,它在分類、聚類和語義相似度等各類任務中都發揮穩健。8,192 詞元的超長上下文視窗在長文件處理中價值突出,即便文件長達數頁,表現依然穩定,而這是大多數競品所不具備的。

最佳實踐

要用好該模型,請確保具備支援 CUDA 的 GPU 環境以發揮最佳效能。它可與 MongoDB、Qdrant、Weaviate、Haystack 等主流向量資料庫和 RAG 框架無縫整合,很容易部署到生產環境。該模型在雙語文件檢索、內容推薦和跨語言文件分析等場景中表現出色。它雖然用途廣泛,但主要針對西班牙語-英語的雙語場景最佳化,用於單語應用或其他語言對時未必是最佳選擇。為獲得最佳效果,輸入文字應規整地使用西班牙語或英語,不過它也能很好地處理混合語言內容。模型支援針對垂直領域做微調,但請事先仔細評估訓練資料的品質與分佈。
提及此模型的部落格
四月 29, 2024 • 7 分鐘閱讀
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
二月 14, 2024 • 4 分鐘閱讀
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。