Jina AI sta ancora una volta dimostrando il suo impegno per modelli di AI multilingue di alta qualità rilasciando il suo modello bilingue spagnolo-inglese.
Questo modello fornisce vettori di embedding per testi fino a 8k token in spagnolo o inglese, progettato in modo che se i testi nelle due lingue significano la stessa cosa, i loro embedding saranno geometricamente vicini. Jina Embeddings v2 per spagnolo e inglese è idealmente adatto per il recupero di informazioni cross-language, l'analisi semantica bilingue e le applicazioni RAG bilingui.
Questo nuovo modello, jina-embeddings-v2-base-es, porta allo spagnolo le stesse prestazioni all'avanguardia e il set di funzionalità innovative dei modelli v2 di Jina AI per inglese, tedesco, cinese e linguaggi di programmazione:
- 8.192 token di contesto di input, un leader tra i modelli di embedding open-source.
- Vero bilinguismo invece di multilinguismo non uniforme. I modelli bilingui di Jina AI sono addestrati per fornire un supporto equilibrato a entrambe le lingue, evitando i pregiudizi dei modelli "multilingue" addestrati su scraping Internet non curati.
- jina-embeddings-v2-base-es è compatto rispetto ai modelli open-source di prestazioni paragonabili. Gli embedding stessi sono di 768 dimensioni, risparmiando spazio e tempo di esecuzione in produzione.
- I modelli Jina Embeddings v2 sono completamente integrati nei principali database vettoriali, framework RAG e librerie di sviluppo AI:
Jina Embeddings v2 per spagnolo e inglese è accessibile tramite la API Embeddings di Jina da subito, con un milione di token gratuiti, quindi non paghi nulla per provarlo.

tagBenchmark
Sui benchmark spagnoli, Jina v2 per spagnolo e inglese supera il modello Multilingual E5 base e il modello BGE M3, gli unici modelli open-source comparabili con supporto per lo spagnolo. I test seguenti (MTEB-es) sono adattati dal Massive Text Embeddings Benchmark. Puoi visualizzarli ed eseguirli da questo repository GitHub.

Jina Embeddings supera E5 su tutte le metriche eccetto la classificazione e supera BGE-M3 nelle attività di recupero, clustering e cross-language, nonostante sia dal 15% al 30% della dimensione di questi modelli più grandi.
- Prestazioni significativamente migliori nelle attività di recupero (come trovare documenti correlati in un database) e clustering (identificare gruppi di documenti che appartengono insieme in una collezione)
- Prestazioni circa uguali a E5 sul reranking (ordinamento di documenti per similarità semantica) e quasi uguali sulla classificazione del testo in spagnolo.
- Tutti e tre i modelli hanno punteggi di benchmark molto simili per le attività cross-language (trovare testi semanticamente simili in inglese per un input in spagnolo, o viceversa), anche se Jina Embeddings ha comunque le prestazioni migliori.
Se confrontato con i modelli multilingue closed-source di Open AI e Cohere, le dimensioni compatte di Jina Embeddings rendono i suoi risultati ancora più impressionanti.

Nelle attività di recupero in spagnolo, Jina supera i modelli closed-source offerti da Open AI e Cohere e supera Open AI (e quasi eguaglia le prestazioni di Cohere) nelle attività cross-language.
tagJina Embeddings: AI per un mondo multilingue
Lo spagnolo è parlato da ben oltre mezzo miliardo di persone, con status ufficiale in più di 20 paesi, insieme all'Unione Europea, le Nazioni Unite, l'Organizzazione Mondiale del Commercio e la FIFA. L'introduzione di questo modello bilingue specializzato rende chiaro l'impegno di Jina AI nel portare le tecnologie AI a tutti.
Oltre allo spagnolo e al suo modello monolingue inglese ad alte prestazioni English monolingual model, Jina AI offre attualmente modelli di embedding all'avanguardia per tedesco, cinese e linguaggi di programmazione, con altri in arrivo.
Jina AI si impegna a far progredire la tecnologia AI per il pubblico più ampio possibile, attribuendo grande importanza alla trasparenza, all'accessibilità, all'economicità, alla privacy e alla protezione dei dati.
Apprezziamo il vostro feedback su tutti i nostri modelli. Unitevi al nostro canale community per contribuire e rimanere informati sui nuovi sviluppi.







