Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Incorporamenti
Licenza Apache 2.0
open_in_new Pubblicazione post

jina-embeddings-v2-base-es

Incorporamenti bilingue spagnolo-inglese con prestazioni SOTA
Licenza
Apache-2.0
Data di rilascio
calendar_month
2024-02-14
Ingresso
abc
Testo
arrow_forward
Produzione
more_horiz
Vettore
Chunking tardivo help_outline
check_circle
Yes
Dettagli del modello
Parametri: 161M
Lunghezza del token di input: 8K
Dimensione di uscita: 768
Modello base help_outline
open_in_new
jina-embeddings-v2-base-en
Lingue addestrate help_outline
2 lingue
Modelli correlati
link
jina-embeddings-v2-base-en
link
jina-embeddings-v2-base-de
link
jina-embeddings-v2-base-zh
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O

Testo

jina-embeddings-v2-base-es

Vettore

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v2-base…Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
46.40
Parameters
161M
Rank by score
24 / 39
Pareto front
Behind it
Distribuzione dei valorihelp_outline
AUC 0.8383
Corpus
Coppie di traduzione
Ricerca documentale
0.6830.000.200.400.600.80
Correlate17.6%
Negativo difficile3.0%
Non correlate0.8%
Soglie consigliate
FPR 0.1 · 0.509
FPR 0.01 · 0.683
FPR 0.001 · 0.775
FPR 0.0001 · 0.834
bilanciata · 0.365
AUC
0.8383
Soglia del rumore
0.774
Crollo del richiamo
0.163
Coppie misurate
119 / 11k
Componenti del vettorehelp_outline
-0.160.000.17
σ 0.0361 · 183k valori
Geometria dell'embeddinghelp_outline
0768
Media per dimensione, passa il cursore per l'intervallo
Rumore di fondo
0.326
Dim. effettive
51 / 768
Coppie linguistichehelp_outline
de-ruen-deen-koen-zhja-ko
Dispersione della soglia tra le coppie: 0.315
Scegli i modelli da confrontare
Pubblicazioni (1)
arXiv
febbraio 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings

Panoramica

Jina Embeddings v2 Base Spanish è un modello di incorporamento di testo bilingue rivoluzionario che affronta la sfida critica del recupero e dell'analisi di informazioni interlinguistiche tra contenuti in spagnolo e inglese. A differenza dei tradizionali modelli multilingue che spesso mostrano una parzialità verso lingue specifiche, questo modello offre prestazioni veramente bilanciate sia in spagnolo che in inglese, rendendolo indispensabile per le organizzazioni che operano nei mercati di lingua spagnola o che gestiscono contenuti bilingue. La caratteristica più notevole del modello è la sua capacità di generare incorporamenti geometricamente allineati: quando i testi in spagnolo e inglese esprimono lo stesso significato, le loro rappresentazioni vettoriali si raggruppano naturalmente nello spazio di incorporamento, consentendo una ricerca e un'analisi interlinguistica senza soluzione di continuità.

Metodi

Al centro di questo modello c'è un'architettura innovativa basata su ALiBi (Attention with Linear Biases) bidirezionale simmetrica, un approccio sofisticato che consente l'elaborazione di sequenze fino a 8.192 token senza i tradizionali embedding posizionali. Il modello utilizza un'architettura BERT modificata con 161M parametri, che incorpora Gated Linear Units (GLU) e tecniche specializzate di normalizzazione dei livelli. L'addestramento segue un processo in tre fasi: pre-addestramento iniziale su un corpus di testo massiccio, seguito da una messa a punto con coppie di testo attentamente curate e, infine, addestramento hard-negative per migliorare la discriminazione tra contenuti simili ma semanticamente distinti. Questo approccio, combinato con embedding a 768 dimensioni, consente al modello di catturare relazioni semantiche sfumate mantenendo l'efficienza computazionale.

Prestazione

Nelle valutazioni di benchmark complete, il modello dimostra capacità eccezionali, in particolare nelle attività di recupero multilingua, dove supera modelli multilingue significativamente più grandi come E5 e BGE-M3, nonostante sia solo il 15-30% delle loro dimensioni. Il modello raggiunge prestazioni superiori nelle attività di recupero e clustering, mostrando una particolare forza nell'abbinamento di contenuti semanticamente equivalenti tra le lingue. Quando testato sul benchmark MTEB, mostra prestazioni robuste in varie attività, tra cui classificazione, clustering e similarità semantica. La finestra di contesto estesa di 8.192 token si dimostra particolarmente preziosa per l'elaborazione di documenti lunghi, mostrando prestazioni costanti anche con documenti che si estendono su più pagine, una capacità di cui sono privi la maggior parte dei modelli concorrenti.

Orientamento

Per utilizzare efficacemente questo modello, le organizzazioni dovrebbero garantire l'accesso a un'infrastruttura GPU compatibile con CUDA per prestazioni ottimali. Il modello si integra perfettamente con i principali database vettoriali e framework RAG, tra cui MongoDB, Qdrant, Weaviate e Haystack, rendendolo facilmente implementabile in ambienti di produzione. Eccelle in applicazioni come la ricerca di documenti bilingue, sistemi di raccomandazione di contenuti e analisi di documenti multilingua. Sebbene il modello mostri una versatilità impressionante, è particolarmente ottimizzato per scenari bilingue spagnolo-inglese e potrebbe non essere la scelta migliore per applicazioni monolingue o scenari che coinvolgono altre coppie di lingue. Per risultati ottimali, i testi di input dovrebbero essere formattati correttamente in spagnolo o inglese, sebbene il modello gestisca efficacemente i contenuti in lingue miste. Il modello supporta la messa a punto per applicazioni specifiche del dominio, ma questo dovrebbe essere affrontato con un'attenta considerazione della qualità e della distribuzione dei dati di training.
Blog che menzionano questo modello
aprile 29, 2024 • 7 minuti letti
Jina Embeddings and Reranker on Azure: Scalable Business-Ready AI Solutions
Jina Embeddings and Rerankers are now available on Azure Marketplace. Enterprises that prioritize privacy and security can now easily integrate Jina AI's state-of-the-art models right in their existing Azure ecosystem.
Susana Guzmán
Futuristic black background with a purple 3D grid, featuring the "Embeddings" and "Reranker" logos with a stylized "A".
febbraio 14, 2024 • 4 minuti letti
Aquí Se Habla Español: Top-Quality Spanish-English Embeddings and 8k Context
Jina AI's new bilingual Spanish-English embedding model brings the state-of-the-art in AI to half a billion Spanish speakers.
Jina AI
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.