Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Embeddings
Licenza Apache 2.0
open_in_new Post di rilascio

jina-embeddings-v2-base-es

Embeddings bilingue spagnolo-inglese con prestazioni SOTA
Licenza
Apache-2.0
Data di rilascio
calendar_month
2024-02-14
Ingresso
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Chunking tardivo help_outline
check_circle
Yes
Dettagli del modello
Parametri: 161M
Lunghezza del token di input: 8K
Dimensione di uscita: 768
Modello base help_outline
jina-bert-v2-base-es
Lingue addestrate help_outline
2 lingue
Modelli correlati
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O

Testo

jina-embeddings-v2-base-es

Vettore

Frontiera di Pareto help_outline
workspace_premium
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parametri (log)Spearman
Questo modello
Sulla frontiera
Jina AI
Altri
MTEB English · sts
83.50
Parametri
161M
Classifica per punteggio
11 / 39
Frontiera di Pareto
Sulla
Distribuzione dei valorihelp_outline
AUC 0.8383
Corpus
Coppie di traduzione
Ricerca documentale
0.6830.000.200.400.600.80
Correlate17.6%
Negativo difficile3.0%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
bilanciata · 0.365
AUC
0.8383
Soglia del rumore
0.774
Crollo del richiamo
0.163
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.160.000.17
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.326
Dim. effettive
51 / 768
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.315
Scegli i modelli da confrontare
Pubblicazioni (1)
arXiv
febbraio 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Panoramica

jina-embeddings-v2-base-es è un modello di embedding del testo bilingue da 161M parametri per spagnolo e inglese, con una finestra di contesto di 8.192 token e output a 768 dimensioni. È stato progettato per la retrieval cross-linguistica nei mercati di lingua spagnola, mappando i contenuti semanticamente equivalenti in spagnolo e inglese in uno spazio di embedding condiviso. Il modello affronta un gap critico: la maggior parte dei modelli di embedding dell'epoca erano incentrati sull'inglese, con le prestazioni in spagnolo significativamente degradate.

Metodi

Il modello usa un backbone basato su BERT con codifiche posizionali ALiBi bidirezionali simmetriche, 161M parametri e uno spazio di output a 768 dimensioni. L'addestramento ha seguito un processo in tre fasi: (1) pre-addestramento su corpora paralleli spagnolo-inglese, (2) fine-tuning contrastivo con mining di negativi difficili su coppie di frasi curate, e (3) allineamento cross-linguistico per assicurare che le rappresentazioni in spagnolo e inglese dello stesso concetto si raggruppino insieme. Il meccanismo ALiBi abilita la finestra di contesto di 8.192 token senza embedding posizionali appresi, permettendo al modello di estrapolare oltre la sua lunghezza di addestramento di 512 token. Il mean pooling produce il vettore di embedding finale.

Prestazione

Il modello ha superato modelli multilingua nettamente più grandi (E5, BGE-M3) nei task di retrieval spagnolo-inglese, essendo solo il 15–30 % della loro dimensione. Ha dimostrato un forte rendimento sui sotto-task MTEB in spagnolo, in particolare nella retrieval e nel clustering. La finestra di contesto di 8.192 token ha fornito prestazioni costanti su documenti di più pagine dove la maggior parte dei modelli concorrenti richiedeva il chunking. Nel 2026, jina-embeddings-v5-text-small rimpiazza questo modello, offrendo 89 lingue, contesto di 32K e adattatori LoRA specifici per il task. Il modello v2-base-es resta un'opzione economicamente vantaggiosa per pipeline dedicate in spagnolo e inglese.

Orientamento

Ideale per la ricerca bilingue spagnolo-inglese, la raccomandazione di contenuti e l'analisi cross-linguistica dei documenti. Per documenti che superano 8.192 token, usa il chunking semantico o il parametro `late_chunking tramite l'API di Jina. Il modello si integra con i principali database vettoriali e framework RAG. Per nuovi progetti che richiedono copertura multilingua oltre lo spagnolo-inglese, contesto di 32K o ottimizzazione specifica per il task, preferisci jina-embeddings-v5-text-small`. GPU con supporto CUDA consigliata per la produzione. Il testo in input dovrebbe essere in spagnolo o in inglese; l'input mistilingua è supportato ma le prestazioni sono ottimizzate per i due linguaggi addestrati.

Blog che menzionano questo modello
aprile 29, 2024 • 7 minuti letti
Jina Embeddings e Reranker su Azure: Soluzioni AI Scalabili Pronte per il Business
Jina Embeddings e Rerankers sono ora disponibili su Azure Marketplace. Le aziende che danno priorità alla privacy e alla sicurezza possono ora integrare facilmente i modelli all'avanguardia di Jina AI direttamente nel loro ecosistema Azure esistente.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
febbraio 14, 2024 • 4 minuti letti
Aquí Se Habla Español: Embeddings Spagnolo-Inglese di Alta Qualità e Contesto di 8k
Il nuovo modello di embedding bilingue spagnolo-inglese di Jina AI porta lo stato dell'arte dell'intelligenza artificiale a mezzo miliardo di parlanti spagnolo.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.