En nuestro reciente artículo, Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings, detallamos nuestro desarrollo de modelos de embedding de texto bilingües alemán-inglés y español-inglés.


Nuestro enfoque utiliza aprendizaje contrastivo multitarea y un avanzado pipeline de curación de datos, centrándose en capacidades bilingües mientras se extiende para admitir 8192 tokens de longitud. Este método permite que nuestros modelos sobresalgan en la comprensión de los idiomas objetivo y en la realización de evaluaciones multilingües de manera eficiente.


Además de los modelos bilingües cubiertos en el artículo, también hemos desarrollado modelos bilingües chino-inglés y monolingües en inglés. Estas adiciones demuestran nuestro compromiso de cubrir un amplio espectro de necesidades lingüísticas y ampliar nuestras capacidades en el procesamiento del lenguaje.


Nuestros modelos bilingües se caracterizan por su eficiencia, operando con tamaños de vocabulario optimizados para requerir menos parámetros y menos memoria. Esta eficiencia subraya nuestra dedicación a crear herramientas potentes pero eficientes en recursos para el procesamiento del lenguaje.
Tras la publicación de nuestro artículo, expandimos el Massive Text Embedding Benchmark (MTEB) para incluir benchmarks para nuestros modelos de embedding inglés-alemán e inglés-español. Esta expansión es parte de nuestro esfuerzo por estimular más investigación y avances en tecnologías de embedding de texto para idiomas distintos al inglés.
En Jina AI, nuestro objetivo es mejorar el procesamiento y la comprensión de múltiples idiomas, contribuyendo al campo del NLP con nuestros desarrollos en modelos de embedding de texto bilingües y monolingües.







