최근 논문 Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings에서 우리는 독일어-영어와 스페인어-영어 이중 언어 텍스트 임베딩 모델의 개발 과정을 상세히 설명했습니다.


우리의 접근 방식은 다중 작업 대조 학습과 고급 데이터 큐레이션 파이프라인을 활용하여 이중 언어 기능에 중점을 두면서 8192 토큰 길이까지 지원하도록 확장했습니다. 이 방법을 통해 우리의 모델은 대상 언어를 이해하고 교차 언어 평가를 효율적으로 수행하는 데 탁월한 성능을 보여줍니다.


논문에서 다룬 이중 언어 모델 외에도 이중 언어 중국어-영어와 단일 언어 영어 모델도 개발했습니다. 이러한 추가 개발은 광범위한 언어적 요구를 충족시키고 언어 처리 능력을 향상시키려는 우리의 노력을 보여줍니다.


우리의 이중 언어 모델은 최적화된 어휘 크기로 작동하여 더 적은 매개변수와 메모리를 필요로 하는 효율성이 특징입니다. 이러한 효율성은 강력하면서도 자원 효율적인 언어 처리 도구를 만들려는 우리의 노력을 보여줍니다.
논문 발표 이후, 우리는 Massive Text Embedding Benchmark (MTEB)를 확장하여 영어-독일어와 영어-스페인어 임베딩 모델에 대한 벤치마크를 포함시켰습니다. 이러한 확장은 비영어권 언어에 대한 텍스트 임베딩 기술의 추가 연구와 발전을 촉진하기 위한 우리의 노력의 일환입니다.
Jina AI에서는 이중 언어 및 단일 언어 텍스트 임베딩 모델 개발을 통해 NLP 분야에 기여하면서 다중 언어의 처리와 이해를 향상시키는 것을 목표로 하고 있습니다.







