Nel nostro recente articolo, Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings, abbiamo dettagliato lo sviluppo dei nostri modelli di embedding di testo bilingue tedesco-inglese e spagnolo-inglese.


Il nostro approccio utilizza l'apprendimento contrastivo multi-task e una pipeline avanzata di curazione dei dati, concentrandosi sulle capacità bilingue e estendendosi fino a supportare 8192 token in lunghezza. Questo metodo permette ai nostri modelli di eccellere nella comprensione delle lingue target e nell'esecuzione efficiente di valutazioni cross-linguistiche.


Oltre ai modelli bilingue trattati nell'articolo, abbiamo anche sviluppato modelli bilingue cinese-inglese e monolingue inglese. Queste aggiunte dimostrano il nostro impegno nel coprire un ampio spettro di esigenze linguistiche e nel potenziare le nostre capacità nell'elaborazione del linguaggio.


I nostri modelli bilingue si caratterizzano per la loro efficienza, operando con dimensioni di vocabolario ottimizzate per richiedere meno parametri e meno memoria. Questa efficienza sottolinea la nostra dedizione nel creare strumenti potenti ma efficienti in termini di risorse per l'elaborazione del linguaggio.
Dopo la pubblicazione del nostro articolo, abbiamo espanso il Massive Text Embedding Benchmark (MTEB) per includere benchmark per i nostri modelli di embedding inglese-tedesco e inglese-spagnolo. Questa espansione fa parte del nostro sforzo per stimolare ulteriori ricerche e progressi nelle tecnologie di text embedding per le lingue non inglesi.
In Jina AI, il nostro obiettivo è migliorare l'elaborazione e la comprensione di più lingue, contribuendo al campo del NLP con i nostri sviluppi nei modelli di text embedding bilingue e monolingue.







