Jina AI в очередной раз снова демонстрирует свою приверженность высококачественным многоязычным моделям ИИ, выпустив свою испано-английскую двуязычную модель.
Эта модель предоставляет векторы эмбеддингов для текстов длиной до 8 тысяч токенов на испанском или английском языках, разработанная таким образом, что если тексты на двух языках имеют одинаковый смысл, их эмбеддинги будут геометрически близки друг к другу. Jina Embeddings v2 для испанского и английского языков идеально подходит для кросс-языкового поиска информации, двуязычного семантического анализа и двуязычных RAG-приложений.
Эта новая модель, jina-embeddings-v2-base-es, привносит в испанский язык такую же передовую производительность и инновационный набор функций, как и модели Jina AI v2 для английского, немецкого, китайского и языков программирования:
- 8 192 входных токенов контекста — лидер среди моделей эмбеддингов с открытым исходным кодом.
- Настоящий билингвизм вместо неравномерной многоязычности. Двуязычные модели Jina AI обучены для обеспечения сбалансированной поддержки обоих языков, избегая предвзятости "многоязычных" моделей, обученных на необработанных интернет-данных.
- jina-embeddings-v2-base-es компактна по сравнению с моделями с открытым исходным кодом сопоставимой производительности. Сами эмбеддинги имеют 768 измерений, экономя пространство и время выполнения в производстве.
- Модели Jina Embeddings v2 полностью интегрированы в основные векторные базы данных, RAG-фреймворки и библиотеки разработки ИИ:
Jina Embeddings v2 для испанского и английского языков доступна прямо сейчас через API Embeddings Jina с миллионом бесплатных токенов, так что вы ничего не платите за её тестирование.

tagБенчмарки
На испанских бенчмарках Jina v2 для испанского и английского языков превосходит модель Multilingual E5 base и модель BGE M3 — единственные сопоставимые модели с открытым исходным кодом с поддержкой испанского языка. Приведенные ниже тесты (MTEB-es) адаптированы из Massive Text Embeddings Benchmark. Вы можете просмотреть их и запустить из этого репозитория GitHub.

Jina Embeddings превосходит E5 по всем метрикам, кроме классификации, и превосходит BGE-M3 в задачах поиска, кластеризации и кросс-языковых задачах, несмотря на то, что её размер составляет всего 15-30% от размера этих более крупных моделей.
- Значительно лучшая производительность в задачах поиска (например, поиск связанных документов в базе данных) и кластеризации (определение групп документов, которые относятся друг к другу в коллекции)
- Примерно равная производительность с E5 в задачах переранжирования (упорядочивание документов по семантическому сходству) и почти равная производительность в задачах классификации текста на испанском языке.
- Все три модели имеют очень похожие показатели бенчмарков для кросс-языковых задач (поиск семантически похожих текстов на английском языке для испанского ввода или наоборот), хотя Jina Embeddings все же показывает лучшие результаты.
При сравнении с закрытыми многоязычными моделями от Open AI и Cohere компактный размер Jina Embeddings делает её достижения ещё более впечатляющими.

В задачах поиска на испанском языке Jina превосходит закрытые модели, предлагаемые Open AI и Cohere, и превосходит Open AI (и почти равна производительности Cohere) в кросс-языковых задачах.
tagJina Embeddings: ИИ для многоязычного мира
На испанском языке говорит более полумиллиарда человек, он имеет официальный статус в более чем 20 странах, а также в Европейском Союзе, Организации Объединенных Наций, Всемирной торговой организации и FIFA. Представление этой специализированной двуязычной модели ясно показывает приверженность Jina AI к предоставлению технологий ИИ для всех.
Помимо испанского языка и высокопроизводительной монолингвальной модели для английского языка, Jina AI в настоящее время предлагает передовые модели встраивания для немецкого, китайского и языков программирования, и это еще не всё.
Jina AI стремится развивать технологии искусственного интеллекта для максимально широкой аудитории, уделяя особое внимание прозрачности, доступности, экономичности, конфиденциальности и защите данных.
Мы ценим ваши отзывы о всех наших моделях. Присоединяйтесь к нашему сообществу, чтобы внести свой вклад и быть в курсе новых разработок.







