Dans notre récent article, Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings, nous avons détaillé le développement de nos modèles d'embeddings textuels bilingues allemand-anglais et espagnol-anglais.


Notre approche utilise l'apprentissage contrastif multi-tâches et un pipeline avancé de conservation des données, en se concentrant sur les capacités bilingues tout en étendant la prise en charge jusqu'à 8192 tokens. Cette méthode permet à nos modèles d'exceller dans la compréhension des langues cibles et dans la réalisation efficace d'évaluations interlingues.


En plus des modèles bilingues présentés dans l'article, nous avons également développé des modèles bilingues chinois-anglais et monolingues anglais. Ces ajouts démontrent notre engagement à couvrir un large spectre de besoins linguistiques et à faire progresser nos capacités en traitement du langage.


Nos modèles bilingues se caractérisent par leur efficacité, fonctionnant avec des tailles de vocabulaire optimisées pour nécessiter moins de paramètres et de mémoire. Cette efficacité souligne notre engagement à créer des outils de traitement du langage à la fois puissants et économes en ressources.
Suite à la publication de notre article, nous avons étendu le Massive Text Embedding Benchmark (MTEB) pour inclure des benchmarks pour nos modèles d'embeddings anglais-allemand et anglais-espagnol. Cette expansion s'inscrit dans notre effort pour stimuler la recherche et les avancées dans les technologies d'embeddings textuels pour les langues non anglaises.
Chez Jina AI, notre objectif est d'améliorer le traitement et la compréhension de multiples langues, en contribuant au domaine du NLP avec nos développements de modèles d'embeddings textuels bilingues et monolingues.







