Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 許可證
open_in_new 釋出部落格

jina-embeddings-v2-base-es

支援西英雙語的 8K 最佳向量模型
許可證
Apache-2.0
釋出日期
calendar_month
2024-02-14
輸入
abc
文字
arrow_forward
輸出
more_horiz
向量
延遲分塊 help_outline
check_circle
Yes
模型詳情
參數: 161M
輸入詞元長度: 8K
輸出維度: 768
底座模型 help_outline
jina-bert-v2-base-es
已訓練語言 help_outline
2 種語言
相關模型
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
可透過以下方式獲取
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
物理隔離
I/O 圖

文字

jina-embeddings-v2-base-es

向量

帕累託前緣 help_outline
workspace_premium
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…參數量(對數)Spearman
本模型
在前緣上
Jina AI
其他
MTEB English · sts
83.50
參數量
161M
按分數的排名
11 / 39
帕累託前緣
在前緣上
取值分佈help_outline
AUC 0.8383
語料
翻譯對
文件檢索
0.6830.000.200.400.600.80
相關17.6%
困難負例3.0%
無關0.8%
推薦閾值
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
均衡 · 0.365
AUC
0.8383
噪聲上限
0.774
召回懸崖
0.163
測量樣本對
119 / 11k
向量分量help_outline
-0.160.000.17
σ 0.0361 · 183k 個數值
向量幾何help_outline
0768
各維度均值,懸停檢視區間
噪聲下限
0.326
有效維度
51 / 768
語言對help_outline
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.315
選擇要比較的模型
論文 (1)
arXiv
二月 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

概述

jina-embeddings-v2-base-es 是一個 161M 參數的西英雙語文字向量模型,具有 8,192 token 的上下文視窗和 768 維輸出。它為西班牙語市場的跨語言檢索而設計,將語意等價的西語英語內容映射到共享的向量空間。該模型解決了一個關鍵缺口:當時大多數向量模型以英語為中心,西語性能顯著下降。

方法

該模型使用帶有對稱雙向 ALiBi 位置編碼的 BERT 骨幹、161M 參數和 768 維輸出空間。訓練遵循三階段流程:(1) 西英平行語料庫上的預訓練,(2) 精選句對上的含困難負樣本挖掘的對比微調,(3) 確保同一概念的西語英語表示聚集在一起的跨語言對齊。ALiBi 機制在不使用學習位置編碼的情況下實現了 8,192 token 的上下文,使模型能外推超過其 512 token 訓練長度。平均池化產生最終的向量。

效能

該模型在西班牙英語檢索任務上顯著超過更大的多語言模型(E5、BGE-M3),而僅為其大小的 15–30%。它在 MTEB 西語子任務上表現出色,尤其在檢索和聚類方面。8,192 token 的上下文視窗在多頁文件上提供了穩定的性能,而大多數競爭模型需要分塊。2026 年,jina-embeddings-v5-text-small 取代該模型,提供 89 種語言、32K 上下文和任務特定 LoRA 適配器。v2-base-es 模型仍是專用西英流水線的經濟實惠選擇。

最佳實踐

非常適合西英雙語搜尋、內容推薦和跨語言文件分析。對於超過 8,192 token 的文件,使用語意分塊或透過 Jina API 的 `late_chunking 參數。該模型可與主要向量資料庫和 RAG 框架整合。對於需要西英之外多語言覆蓋、32K 上下文或任務特定最佳化的新專案,請優先使用 jina-embeddings-v5-text-small`。生產環境建議使用支援 CUDA 的 GPU。輸入文字應為西班牙語或英語;支援混合語言輸入,但性能針對兩種訓練語言最佳化。

提及此模型的部落格
四月 29, 2024 • 7 分鐘閱讀
Jina Embeddings 和 Reranker 在 Azure 上的應用:可擴展的企業級 AI 解決方案
Jina Embeddings 和 Rerankers 現已在 Azure Marketplace 上架。重視隱私和安全的企業現在可以輕鬆地將 Jina AI 的最先進模型整合到其現有的 Azure 生態系統中。
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
二月 14, 2024 • 4 分鐘閱讀
此可使用西班牙語:頂級西班牙語-英語 Embeddings 與 8k 上下文
Jina AI 的新型西班牙語-英語雙語嵌入模型,為全球五億西班牙語使用者帶來最先進的 AI 技術。
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。