Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Бенчмарки
Jina Embeddings: ИИ для многоязычного мира
пресс-релиз
февраль 14, 2024

Aquí Se Habla Español: Высококачественные испанско-английские эмбеддинги с контекстом 8 тыс. токенов

Новая двуязычная модель векторных представлений испанского и английского языков от Jina AI делает передовые технологии искусственного интеллекта доступными для полумиллиарда испаноговорящих людей.
Digital wireframe rendering of a Gothic-style cathedral, with colorful outlines and pointed spires on a dark background.
Jina AI • 4 минуты чтения

Jina AI в очередной раз снова демонстрирует свою приверженность высококачественным многоязычным моделям ИИ, выпустив свою испано-английскую двуязычную модель.

Эта модель предоставляет векторы эмбеддингов для текстов длиной до 8 тысяч токенов на испанском или английском языках, разработанная таким образом, что если тексты на двух языках имеют одинаковый смысл, их эмбеддинги будут геометрически близки друг к другу. Jina Embeddings v2 для испанского и английского языков идеально подходит для кросс-языкового поиска информации, двуязычного семантического анализа и двуязычных RAG-приложений.

Эта новая модель, jina-embeddings-v2-base-es, привносит в испанский язык такую же передовую производительность и инновационный набор функций, как и модели Jina AI v2 для английского, немецкого, китайского и языков программирования:

  • 8 192 входных токенов контекста — лидер среди моделей эмбеддингов с открытым исходным кодом.
  • Настоящий билингвизм вместо неравномерной многоязычности. Двуязычные модели Jina AI обучены для обеспечения сбалансированной поддержки обоих языков, избегая предвзятости "многоязычных" моделей, обученных на необработанных интернет-данных.
  • jina-embeddings-v2-base-es компактна по сравнению с моделями с открытым исходным кодом сопоставимой производительности. Сами эмбеддинги имеют 768 измерений, экономя пространство и время выполнения в производстве.
  • Модели Jina Embeddings v2 полностью интегрированы в основные векторные базы данных, RAG-фреймворки и библиотеки разработки ИИ:
    • MongoDB
    • Qdrant
    • Weaviate
    • Haystack
    • LlamaIndex.

Jina Embeddings v2 для испанского и английского языков доступна прямо сейчас через API Embeddings Jina с миллионом бесплатных токенов, так что вы ничего не платите за её тестирование.

Embedding API
Start with 1M free tokens. Top-performing, 8192 context length bilingual embeddings for your search and RAG systems.

tagБенчмарки

На испанских бенчмарках Jina v2 для испанского и английского языков превосходит модель Multilingual E5 base и модель BGE M3 — единственные сопоставимые модели с открытым исходным кодом с поддержкой испанского языка. Приведенные ниже тесты (MTEB-es) адаптированы из Massive Text Embeddings Benchmark. Вы можете просмотреть их и запустить из этого репозитория GitHub.

GitHub - jina-ai/mteb-es: MTEB: Massive Text Embedding Benchmark with Spanish datasets
MTEB: Massive Text Embedding Benchmark with Spanish datasets - jina-ai/mteb-es
GitHubjina-ai
Technical table displaying models, sizes, and performance metrics for cross-language, retrieval, and classification tasks.

Jina Embeddings превосходит E5 по всем метрикам, кроме классификации, и превосходит BGE-M3 в задачах поиска, кластеризации и кросс-языковых задачах, несмотря на то, что её размер составляет всего 15-30% от размера этих более крупных моделей.

  • Значительно лучшая производительность в задачах поиска (например, поиск связанных документов в базе данных) и кластеризации (определение групп документов, которые относятся друг к другу в коллекции)
  • Примерно равная производительность с E5 в задачах переранжирования (упорядочивание документов по семантическому сходству) и почти равная производительность в задачах классификации текста на испанском языке.
  • Все три модели имеют очень похожие показатели бенчмарков для кросс-языковых задач (поиск семантически похожих текстов на английском языке для испанского ввода или наоборот), хотя Jina Embeddings все же показывает лучшие результаты.

При сравнении с закрытыми многоязычными моделями от Open AI и Cohere компактный размер Jina Embeddings делает её достижения ещё более впечатляющими.

Table comparing machine translation systems with models, vendors, and metrics like Spanish benchmarks and cross-language rera

В задачах поиска на испанском языке Jina превосходит закрытые модели, предлагаемые Open AI и Cohere, и превосходит Open AI (и почти равна производительности Cohere) в кросс-языковых задачах.

tagJina Embeddings: ИИ для многоязычного мира

На испанском языке говорит более полумиллиарда человек, он имеет официальный статус в более чем 20 странах, а также в Европейском Союзе, Организации Объединенных Наций, Всемирной торговой организации и FIFA. Представление этой специализированной двуязычной модели ясно показывает приверженность Jina AI к предоставлению технологий ИИ для всех.

Помимо испанского языка и высокопроизводительной монолингвальной модели для английского языка, Jina AI в настоящее время предлагает передовые модели встраивания для немецкого, китайского и языков программирования, и это еще не всё.

Jina AI стремится развивать технологии искусственного интеллекта для максимально широкой аудитории, уделяя особое внимание прозрачности, доступности, экономичности, конфиденциальности и защите данных.

Мы ценим ваши отзывы о всех наших моделях. Присоединяйтесь к нашему сообществу, чтобы внести свой вклад и быть в курсе новых разработок.

Embedding API
Начните с 1 млн бесплатных токенов. Высокопроизводительные двуязычные встраивания с контекстной длиной 8192 для ваших систем поиска и RAG.
Категории:
пресс-релиз
rss_feed

Читать далее
август 03, 2026 • 11 минуты чтения
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
февраль 19, 2026 • 7 минуты чтения
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.