Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Бенчмарки
Jina Embeddings: ИИ для многоязычного мира
Пресс-релиз
февраль 14, 2024

Aquí Se Habla Español: Высококачественные испанско-английские эмбеддинги с контекстом 8 тыс. токенов

Новая двуязычная модель векторных представлений испанского и английского языков от Jina AI делает передовые технологии искусственного интеллекта доступными для полумиллиарда испаноговорящих людей.
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Jina AI • 4 минуты чтения

Jina AI в очередной раз снова демонстрирует свою приверженность высококачественным многоязычным моделям ИИ, выпустив свою испано-английскую двуязычную модель.

Эта модель предоставляет векторы эмбеддингов для текстов длиной до 8 тысяч токенов на испанском или английском языках, разработанная таким образом, что если тексты на двух языках имеют одинаковый смысл, их эмбеддинги будут геометрически близки друг к другу. Jina Embeddings v2 для испанского и английского языков идеально подходит для кросс-языкового поиска информации, двуязычного семантического анализа и двуязычных RAG-приложений.

Эта новая модель, jina-embeddings-v2-base-es, привносит в испанский язык такую же передовую производительность и инновационный набор функций, как и модели Jina AI v2 для английского, немецкого, китайского и языков программирования:

  • 8 192 входных токенов контекста — лидер среди моделей эмбеддингов с открытым исходным кодом.
  • Настоящий билингвизм вместо неравномерной многоязычности. Двуязычные модели Jina AI обучены для обеспечения сбалансированной поддержки обоих языков, избегая предвзятости "многоязычных" моделей, обученных на необработанных интернет-данных.
  • jina-embeddings-v2-base-es компактна по сравнению с моделями с открытым исходным кодом сопоставимой производительности. Сами эмбеддинги имеют 768 измерений, экономя пространство и время выполнения в производстве.
  • Модели Jina Embeddings v2 полностью интегрированы в основные векторные базы данных, RAG-фреймворки и библиотеки разработки ИИ:
    • MongoDB
    • Qdrant
    • Weaviate
    • Haystack
    • LlamaIndex.

Jina Embeddings v2 для испанского и английского языков доступна прямо сейчас через API Embeddings Jina с миллионом бесплатных токенов, так что вы ничего не платите за её тестирование.

Embedding API
Start with 1M free tokens. Top-performing, 8192 context length bilingual embeddings for your search and RAG systems.

tagБенчмарки

На испанских бенчмарках Jina v2 для испанского и английского языков превосходит модель Multilingual E5 base и модель BGE M3 — единственные сопоставимые модели с открытым исходным кодом с поддержкой испанского языка. Приведенные ниже тесты (MTEB-es) адаптированы из Massive Text Embeddings Benchmark. Вы можете просмотреть их и запустить из этого репозитория GitHub.

GitHub - jina-ai/mteb-es: MTEB: Massive Text Embedding Benchmark with Spanish datasets
MTEB: Massive Text Embedding Benchmark with Spanish datasets - jina-ai/mteb-es
GitHubjina-ai
Technical table displaying models, sizes, and performance metrics for cross-language, retrieval, and classification tasks.

Jina Embeddings превосходит E5 по всем метрикам, кроме классификации, и превосходит BGE-M3 в задачах поиска, кластеризации и кросс-языковых задачах, несмотря на то, что её размер составляет всего 15-30% от размера этих более крупных моделей.

  • Значительно лучшая производительность в задачах поиска (например, поиск связанных документов в базе данных) и кластеризации (определение групп документов, которые относятся друг к другу в коллекции)
  • Примерно равная производительность с E5 в задачах переранжирования (упорядочивание документов по семантическому сходству) и почти равная производительность в задачах классификации текста на испанском языке.
  • Все три модели имеют очень похожие показатели бенчмарков для кросс-языковых задач (поиск семантически похожих текстов на английском языке для испанского ввода или наоборот), хотя Jina Embeddings все же показывает лучшие результаты.

При сравнении с закрытыми многоязычными моделями от Open AI и Cohere компактный размер Jina Embeddings делает её достижения ещё более впечатляющими.

Table comparing machine translation systems with models, vendors, and metrics like Spanish benchmarks and cross-language rera

В задачах поиска на испанском языке Jina превосходит закрытые модели, предлагаемые Open AI и Cohere, и превосходит Open AI (и почти равна производительности Cohere) в кросс-языковых задачах.

tagJina Embeddings: ИИ для многоязычного мира

На испанском языке говорит более полумиллиарда человек, он имеет официальный статус в более чем 20 странах, а также в Европейском Союзе, Организации Объединенных Наций, Всемирной торговой организации и FIFA. Представление этой специализированной двуязычной модели ясно показывает приверженность Jina AI к предоставлению технологий ИИ для всех.

Помимо испанского языка и высокопроизводительной монолингвальной модели для английского языка, Jina AI в настоящее время предлагает передовые модели встраивания для немецкого, китайского и языков программирования, и это еще не всё.

Jina AI стремится развивать технологии искусственного интеллекта для максимально широкой аудитории, уделяя особое внимание прозрачности, доступности, экономичности, конфиденциальности и защите данных.

Мы ценим ваши отзывы о всех наших моделях. Присоединяйтесь к нашему сообществу, чтобы внести свой вклад и быть в курсе новых разработок.

Embedding API
Начните с 1 млн бесплатных токенов. Высокопроизводительные двуязычные встраивания с контекстной длиной 8192 для ваших систем поиска и RAG.
Категории:
Пресс-релиз
rss_feed

Читать далее
август 03, 2026 • 11 минуты чтения
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
февраль 19, 2026 • 7 минуты чтения
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.