Grafico I/O

Testo

jina-embeddings-v2-base-es

Vettore

Frontiera di Pareto
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-b-en-v1jina-embedding-s-en-v1jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parametri (log)Spearman
Questo modello
Sulla frontiera
Jina AI
Altri
MTEB English · sts
83.50
Parametri
161M
Classifica per punteggio
11 / 39
Frontiera di Pareto
Sulla
Distribuzione dei valori
AUC 0.8383
Corpus
Coppie di traduzione
Ricerca documentale
0.6830.000.200.400.600.80
Correlate17.6%
Negativo difficile3.0%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
bilanciata · 0.365
AUC
0.8383
Soglia del rumore
0.774
Crollo del richiamo
0.163
Coppie misurate
119 / 11k
Componenti del vettore
-0.160.000.17
σ 0.0361 · 183k valori
Geometria dell'embedding
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.326
Dim. effettive
51 / 768
Coppie linguistiche
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.315
Scegli i modelli da confrontare
Pubblicazioni (1)

Panoramica

jina-embeddings-v2-base-es è un modello di embedding del testo bilingue da 161M parametri per spagnolo e inglese, con una finestra di contesto di 8.192 token e output a 768 dimensioni. È stato progettato per la retrieval cross-linguistica nei mercati di lingua spagnola, mappando i contenuti semanticamente equivalenti in spagnolo e inglese in uno spazio di embedding condiviso. Il modello affronta un gap critico: la maggior parte dei modelli di embedding dell'epoca erano incentrati sull'inglese, con le prestazioni in spagnolo significativamente degradate.

Metodi

Il modello usa un backbone basato su BERT con codifiche posizionali ALiBi bidirezionali simmetriche, 161M parametri e uno spazio di output a 768 dimensioni. L'addestramento ha seguito un processo in tre fasi: (1) pre-addestramento su corpora paralleli spagnolo-inglese, (2) fine-tuning contrastivo con mining di negativi difficili su coppie di frasi curate, e (3) allineamento cross-linguistico per assicurare che le rappresentazioni in spagnolo e inglese dello stesso concetto si raggruppino insieme. Il meccanismo ALiBi abilita la finestra di contesto di 8.192 token senza embedding posizionali appresi, permettendo al modello di estrapolare oltre la sua lunghezza di addestramento di 512 token. Il mean pooling produce il vettore di embedding finale.

Prestazione

Il modello ha superato modelli multilingua nettamente più grandi (E5, BGE-M3) nei task di retrieval spagnolo-inglese, essendo solo il 15–30 % della loro dimensione. Ha dimostrato un forte rendimento sui sotto-task MTEB in spagnolo, in particolare nella retrieval e nel clustering. La finestra di contesto di 8.192 token ha fornito prestazioni costanti su documenti di più pagine dove la maggior parte dei modelli concorrenti richiedeva il chunking. Nel 2026, jina-embeddings-v5-text-small rimpiazza questo modello, offrendo 89 lingue, contesto di 32K e adattatori LoRA specifici per il task. Il modello v2-base-es resta un'opzione economicamente vantaggiosa per pipeline dedicate in spagnolo e inglese.

Orientamento

Ideale per la ricerca bilingue spagnolo-inglese, la raccomandazione di contenuti e l'analisi cross-linguistica dei documenti. Per documenti che superano 8.192 token, usa il chunking semantico o il parametro `late_chunking tramite l'API di Jina. Il modello si integra con i principali database vettoriali e framework RAG. Per nuovi progetti che richiedono copertura multilingua oltre lo spagnolo-inglese, contesto di 32K o ottimizzazione specifica per il task, preferisci jina-embeddings-v5-text-small`. GPU con supporto CUDA consigliata per la produzione. Il testo in input dovrebbe essere in spagnolo o in inglese; l'input mistilingua è supportato ma le prestazioni sono ottimizzate per i due linguaggi addestrati.

Blog che menzionano questo modello