Comunicato stampa
febbraio 14, 2024

Aquí Se Habla Español: Embeddings Spagnolo-Inglese di Alta Qualità e Contesto di 8k

Il nuovo modello di embedding bilingue spagnolo-inglese di Jina AI porta lo stato dell'arte dell'intelligenza artificiale a mezzo miliardo di parlanti spagnolo.
Jina AI • 4 minuti letti

Jina AI sta ancora una volta dimostrando il suo impegno per modelli di AI multilingue di alta qualità rilasciando il suo modello bilingue spagnolo-inglese.

Questo modello fornisce vettori di embedding per testi fino a 8k token in spagnolo o inglese, progettato in modo che se i testi nelle due lingue significano la stessa cosa, i loro embedding saranno geometricamente vicini. Jina Embeddings v2 per spagnolo e inglese è idealmente adatto per il recupero di informazioni cross-language, l'analisi semantica bilingue e le applicazioni RAG bilingui.

Questo nuovo modello, jina-embeddings-v2-base-es, porta allo spagnolo le stesse prestazioni all'avanguardia e il set di funzionalità innovative dei modelli v2 di Jina AI per inglese, tedesco, cinese e linguaggi di programmazione:

  • 8.192 token di contesto di input, un leader tra i modelli di embedding open-source.
  • Vero bilinguismo invece di multilinguismo non uniforme. I modelli bilingui di Jina AI sono addestrati per fornire un supporto equilibrato a entrambe le lingue, evitando i pregiudizi dei modelli "multilingue" addestrati su scraping Internet non curati.
  • jina-embeddings-v2-base-es è compatto rispetto ai modelli open-source di prestazioni paragonabili. Gli embedding stessi sono di 768 dimensioni, risparmiando spazio e tempo di esecuzione in produzione.
  • I modelli Jina Embeddings v2 sono completamente integrati nei principali database vettoriali, framework RAG e librerie di sviluppo AI:

Jina Embeddings v2 per spagnolo e inglese è accessibile tramite la API Embeddings di Jina da subito, con un milione di token gratuiti, quindi non paghi nulla per provarlo.

Embedding API
Inizia con 1M di token gratuiti. Embedding bilingui con prestazioni superiori e lunghezza di contesto di 8192 per i tuoi sistemi di ricerca e RAG.

tagBenchmark

Sui benchmark spagnoli, Jina v2 per spagnolo e inglese supera il modello Multilingual E5 base e il modello BGE M3, gli unici modelli open-source comparabili con supporto per lo spagnolo. I test seguenti (MTEB-es) sono adattati dal Massive Text Embeddings Benchmark. Puoi visualizzarli ed eseguirli da questo repository GitHub.

GitHub - jina-ai/mteb-es: MTEB: Massive Text Embedding Benchmark con dataset spagnoli
MTEB: Massive Text Embedding Benchmark con dataset spagnoli - jina-ai/mteb-es
Tabella tecnica che mostra modelli, dimensioni e metriche di prestazione per attività cross-language, recupero e classificazione.

Jina Embeddings supera E5 su tutte le metriche eccetto la classificazione e supera BGE-M3 nelle attività di recupero, clustering e cross-language, nonostante sia dal 15% al 30% della dimensione di questi modelli più grandi.

  • Prestazioni significativamente migliori nelle attività di recupero (come trovare documenti correlati in un database) e clustering (identificare gruppi di documenti che appartengono insieme in una collezione)
  • Prestazioni circa uguali a E5 sul reranking (ordinamento di documenti per similarità semantica) e quasi uguali sulla classificazione del testo in spagnolo.
  • Tutti e tre i modelli hanno punteggi di benchmark molto simili per le attività cross-language (trovare testi semanticamente simili in inglese per un input in spagnolo, o viceversa), anche se Jina Embeddings ha comunque le prestazioni migliori.

Se confrontato con i modelli multilingue closed-source di Open AI e Cohere, le dimensioni compatte di Jina Embeddings rendono i suoi risultati ancora più impressionanti.

Tabella che confronta sistemi di traduzione automatica con modelli, fornitori e metriche come benchmark spagnoli e reranking cross-language

Nelle attività di recupero in spagnolo, Jina supera i modelli closed-source offerti da Open AI e Cohere e supera Open AI (e quasi eguaglia le prestazioni di Cohere) nelle attività cross-language.

tagJina Embeddings: AI per un mondo multilingue

Lo spagnolo è parlato da ben oltre mezzo miliardo di persone, con status ufficiale in più di 20 paesi, insieme all'Unione Europea, le Nazioni Unite, l'Organizzazione Mondiale del Commercio e la FIFA. L'introduzione di questo modello bilingue specializzato rende chiaro l'impegno di Jina AI nel portare le tecnologie AI a tutti.

Oltre allo spagnolo e al suo modello monolingue inglese ad alte prestazioni English monolingual model, Jina AI offre attualmente modelli di embedding all'avanguardia per tedesco, cinese e linguaggi di programmazione, con altri in arrivo.

Jina AI si impegna a far progredire la tecnologia AI per il pubblico più ampio possibile, attribuendo grande importanza alla trasparenza, all'accessibilità, all'economicità, alla privacy e alla protezione dei dati.

Apprezziamo il vostro feedback su tutti i nostri modelli. Unitevi al nostro canale community per contribuire e rimanere informati sui nuovi sviluppi.

Embedding API
Inizia con 1M di token gratuiti. Embedding bilingue con prestazioni elevate e lunghezza del contesto di 8192 per i tuoi sistemi di ricerca e RAG.
Categorie:
Comunicato stampa

Per saperne di più
settembre 14, 2026 • 9 minuti letti
jina-ocr-v1: Faster Document Parsing on Low-Budget GPUs
agosto 03, 2026 • 11 minuti letti
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
maggio 12, 2026 • 7 minuti letti
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video