Пресс-релиз
февраль 14, 2024

Aquí Se Habla Español: Высококачественные испанско-английские эмбеддинги с контекстом 8 тыс. токенов

Новая двуязычная модель векторных представлений испанского и английского языков от Jina AI делает передовые технологии искусственного интеллекта доступными для полумиллиарда испаноговорящих людей.
Jina AI • 4 минуты чтения

Jina AI в очередной раз снова демонстрирует свою приверженность высококачественным многоязычным моделям ИИ, выпустив свою испано-английскую двуязычную модель.

Эта модель предоставляет векторы эмбеддингов для текстов длиной до 8 тысяч токенов на испанском или английском языках, разработанная таким образом, что если тексты на двух языках имеют одинаковый смысл, их эмбеддинги будут геометрически близки друг к другу. Jina Embeddings v2 для испанского и английского языков идеально подходит для кросс-языкового поиска информации, двуязычного семантического анализа и двуязычных RAG-приложений.

Эта новая модель, jina-embeddings-v2-base-es, привносит в испанский язык такую же передовую производительность и инновационный набор функций, как и модели Jina AI v2 для английского, немецкого, китайского и языков программирования:

  • 8 192 входных токенов контекста — лидер среди моделей эмбеддингов с открытым исходным кодом.
  • Настоящий билингвизм вместо неравномерной многоязычности. Двуязычные модели Jina AI обучены для обеспечения сбалансированной поддержки обоих языков, избегая предвзятости "многоязычных" моделей, обученных на необработанных интернет-данных.
  • jina-embeddings-v2-base-es компактна по сравнению с моделями с открытым исходным кодом сопоставимой производительности. Сами эмбеддинги имеют 768 измерений, экономя пространство и время выполнения в производстве.
  • Модели Jina Embeddings v2 полностью интегрированы в основные векторные базы данных, RAG-фреймворки и библиотеки разработки ИИ:

Jina Embeddings v2 для испанского и английского языков доступна прямо сейчас через API Embeddings Jina с миллионом бесплатных токенов, так что вы ничего не платите за её тестирование.

Embedding API
Start with 1M free tokens. Top-performing, 8192 context length bilingual embeddings for your search and RAG systems.

tagБенчмарки

На испанских бенчмарках Jina v2 для испанского и английского языков превосходит модель Multilingual E5 base и модель BGE M3 — единственные сопоставимые модели с открытым исходным кодом с поддержкой испанского языка. Приведенные ниже тесты (MTEB-es) адаптированы из Massive Text Embeddings Benchmark. Вы можете просмотреть их и запустить из этого репозитория GitHub.

GitHub - jina-ai/mteb-es: MTEB: Massive Text Embedding Benchmark with Spanish datasets
MTEB: Massive Text Embedding Benchmark with Spanish datasets - jina-ai/mteb-es
Technical table displaying models, sizes, and performance metrics for cross-language, retrieval, and classification tasks.

Jina Embeddings превосходит E5 по всем метрикам, кроме классификации, и превосходит BGE-M3 в задачах поиска, кластеризации и кросс-языковых задачах, несмотря на то, что её размер составляет всего 15-30% от размера этих более крупных моделей.

  • Значительно лучшая производительность в задачах поиска (например, поиск связанных документов в базе данных) и кластеризации (определение групп документов, которые относятся друг к другу в коллекции)
  • Примерно равная производительность с E5 в задачах переранжирования (упорядочивание документов по семантическому сходству) и почти равная производительность в задачах классификации текста на испанском языке.
  • Все три модели имеют очень похожие показатели бенчмарков для кросс-языковых задач (поиск семантически похожих текстов на английском языке для испанского ввода или наоборот), хотя Jina Embeddings все же показывает лучшие результаты.

При сравнении с закрытыми многоязычными моделями от Open AI и Cohere компактный размер Jina Embeddings делает её достижения ещё более впечатляющими.

Table comparing machine translation systems with models, vendors, and metrics like Spanish benchmarks and cross-language rera

В задачах поиска на испанском языке Jina превосходит закрытые модели, предлагаемые Open AI и Cohere, и превосходит Open AI (и почти равна производительности Cohere) в кросс-языковых задачах.

tagJina Embeddings: ИИ для многоязычного мира

На испанском языке говорит более полумиллиарда человек, он имеет официальный статус в более чем 20 странах, а также в Европейском Союзе, Организации Объединенных Наций, Всемирной торговой организации и FIFA. Представление этой специализированной двуязычной модели ясно показывает приверженность Jina AI к предоставлению технологий ИИ для всех.

Помимо испанского языка и высокопроизводительной монолингвальной модели для английского языка, Jina AI в настоящее время предлагает передовые модели встраивания для немецкого, китайского и языков программирования, и это еще не всё.

Jina AI стремится развивать технологии искусственного интеллекта для максимально широкой аудитории, уделяя особое внимание прозрачности, доступности, экономичности, конфиденциальности и защите данных.

Мы ценим ваши отзывы о всех наших моделях. Присоединяйтесь к нашему сообществу, чтобы внести свой вклад и быть в курсе новых разработок.

Embedding API
Начните с 1 млн бесплатных токенов. Высокопроизводительные двуязычные встраивания с контекстной длиной 8192 для ваших систем поиска и RAG.
Категории:
Пресс-релиз

Читать далее
сентябрь 14, 2026 • 9 минуты чтения
jina-ocr-v1: Faster Document Parsing on Low-Budget GPUs
август 03, 2026 • 11 минуты чтения
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video