Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Архитектура
Начало работы
Обучение
Заключение
star
Избранное
пресс-релиз
май 12, 2026

jina-embeddings-v5-omni: Векторные модели для текста, изображений, аудио и видео

Одна модель, четыре модальности: текст, изображение, аудио, видео. Лучшие в своем классе омни-векторные модели (Embeddings) с 1,6 млрд и 0,9 млрд параметров.
Han Xiao
Han Xiao • 7 минуты чтения
jina-embeddings-v5-omni — коллекция от jinaai
Мультимодальные (текст + изображение + видео + аудио) векторные модели, согласованные с jina-embeddings-v5-text-*. Два размера, по четыре варианта задач для каждого.
Коллекция от jinaai
jina-embeddings-v5-omni: Мультимодальные векторные модели с сохранением геометрии текста посредством композиции замороженных башен
В этой работе мы представляем композицию моделей с замороженным энкодером — новый подход к созданию мультимодальных векторных моделей. Мы опираемся на архитектуру в стиле VLM, в которой нетекстовые энкодеры адаптируются для создания входных данных для большой языковой модели (LLM), которая, в свою очередь, генерирует векторные представления (embeddings) для всех видов входных данных. Мы представляем результат: пакет jina-embeddings-v5-omni, пару моделей, которые кодируют текст, изображения, аудио и видео в единое семантическое векторное пространство. Наш метод заключается в расширении двух текстовых моделей Jina Embeddings v5 для поддержки дополнительных медиаданных путем добавления энкодеров для изображений и аудио. Базовые текстовые векторные модели и добавленные нетекстовые медиа-энкодеры остаются замороженными. Мы обучили только связующие компоненты, что составляет 0,35% от общего количества весов объединенной модели. Таким образом, обучение проходит гораздо эффективнее, чем при полной перенастройке параметров. Кроме того, языковая модель остается практически неизменной, создавая точно такие же векторные представления для текстовых входных данных, как и модели Jina Embeddings v5 Text. Наши оценки показывают, что этот подход дает результаты, конкурентоспособные с современными аналогами, обеспечивая почти равную производительность с более крупными мультимодальными векторными моделями.
arXiv.orgFlorian Hönicke

Мы выпускаем jina-embeddings-v5-omni, расширяя наши векторные модели v5-text поддержкой изображений, аудио и видео. Обе модели используют ту же замороженную текстовую основу, что и v5-text, а это означает, что векторные представления текста идентичны — переиндексация не требуется. jina-embeddings-v5-omni-small набирает в среднем 53,93 балла по четырем модальностям, что соответствует LCO-7B (54,43) при в 5,7 раза меньшем количестве параметров, в то время как jina-embeddings-v5-omni-nano обеспечивает конкурентоспособный поиск документов всего при 0,95 млрд параметров.

Pareto frontier
Граница Парето для всех omni-моделей с открытыми весами (поддерживающих текст, изображения, аудио и видео). jina-embeddings-v5-omni-small (1,57 млрд) соответствует среднему баллу LCO-7B (8,93 млрд), используя при этом в 5,7 раза меньше параметров. jina-embeddings-v5-omni-nano (0,95 млрд) превосходит LanguageBind (1,14 млрд) на +8,9 балла. Базовые модели: LanguageBind, Omni-Embed-Nemotron-3B, LCO-Embedding-Omni-3B, LCO-Embedding-Omni-7B.
Per-modality scores
Разбивка по модальностям: текст (MMTEB), изображения (MIEB), видео (MMEB-Video) и аудио (MAEB). jina-embeddings-v5-omni-small лидирует среди всех omni-моделей по тексту с показателем 67,0, наследуя полное качество jina-embeddings-v5-text-small. В работе с изображениями (56,05) модель превосходно справляется с классификацией (68,55) и кластеризацией (84,57 — лучший показатель среди всех моделей). Аудио (51,46) близко к LCO-7B (52,37), при этом демонстрируя лучший результат в классификации аудио (55,89). Видео (41,20) — это текущий разрыв по сравнению с LCO-7B (47,41), поскольку временные рассуждения выигрывают от обучения «end-to-end».
Task breakdown
Производительность по 13 типам задач. Золотыми звездами отмечены задачи, в которых jina-embeddings-v5-omni-small превосходит лучшую базовую модель с открытыми весами (в 3–9 раз больше). Победы: классификация изображений (68,55 против 64,30), кластеризация изображений (84,57 против 83,24), классификация аудио (55,89 против 53,39). Основные пробелы: поиск видео (27,82 против 58,73) и композиционный поиск/VQA (44,23 против 53,40).
Document retrieval
Поиск документов (ViDoRe-in-MIEB). jina-embeddings-v5-omni-small с 0,92 млрд активных текстовых и визуальных параметров набирает 79,08, превосходя LCO-3B (78,24 при 4,07 млрд). jina-embeddings-v5-omni-nano набирает 70,05 всего с 0,31 млрд активных параметров, что значительно выше, чем у LanguageBind (37,33). Nemotron-3B лидирует с 85,64, но использует в 5,1 раза больше параметров.

tagАрхитектура

v5-omni сохраняет основу v5-text полностью замороженной и добавляет предварительно обученные визуальные и аудио-энкодеры, связанные через небольшие обучаемые проекторы:

  • Зрение: визуальные энкодеры Qwen3.5 (адаптированные из SigLIP2) с пространственным объединением 2x2 (уменьшение количества токенов в 4 раза). Мы замораживаем всё, кроме финального проекционного слоя (fc_vision_2), который заменяем случайным образом инициализированным слоем, проецирующим данные в скрытую размерность текстовой основы.
  • Аудио: энкодер Qwen2.5-Omni (адаптирован из Whisper-large-v3). Единственный случайным образом инициализированный слой fc_audio проецирует 1280-мерный вывод в текстовую основу.
  • Видео: обрабатывается как последовательность визуальных кадров, при необходимости предваряемая извлеченным аудиосегментом.

Модель наследует четыре специфичных для задач адаптера LoRA от v5-text (поиск, сопоставление текста, классификация, кластеризация) и обучает отдельные веса проектора для каждого варианта задачи. Архитектура полностью модульная: развертывание только для текста не загружает веса зрения или аудио (идентично объему v5-text), только для изображений — пропускает аудио, полный omni — загружает всё.

Architecture
Архитектура v5-omni. Замороженные визуальные и аудио-энкодеры подают данные через обучаемые проекторы в замороженную текстовую основу. Обучаются только проекторы (0,35% от общих весов). Специализированные адаптеры LoRA отвечают за поиск, классификацию, кластеризацию и сопоставление текста.
Характеристикаjina-embeddings-v5-omni-smalljina-embeddings-v5-omni-nano
Базовая текстовая модельjina-embeddings-v5-text-small (Qwen3-0.6B)jina-embeddings-v5-text-nano (EuroBERT-210m)
Общее количество параметров~1,56 млрд~1,04 млрд
МодальностиТекст, изображение, аудио, видео, PDFТекст, изображение, аудио, видео, PDF
Размерности векторов1024768
Размерности Matryoshka32, 64, 128, 256, 512, 768, 102432, 64, 128, 256, 512, 768
Максимальная длина последовательности32768词元8192词元
Визуальный энкодерQwen3.5-2B ViT (SigLIP2)SigLIP2 Base
Аудио-энкодерWhisper-large-v3Whisper-large-v3
Задачипоиск, сопоставление текста, классификация, кластеризацияпоиск, сопоставление текста, классификация, кластеризация
Совместимость с текстомИдентично jina-embeddings-v5-text-smallИдентично jina-embeddings-v5-text-nano
Обучаемые параметры~18 млн проекторов (0,35%)~7 млн проекторов (0,35%)
ПулингLast-tokenLast-token
ЛицензияCC BY-NC 4.0CC BY-NC 4.0

tagНачало работы

tagElasticsearch (Elastic Inference Service)

Если вы уже используете jina-embeddings-v5-text в Elasticsearch, ваши существующие текстовые индексы будут работать с v5-omni без каких-либо дополнительных настроек. Модели omni генерируют идентичные векторные модели (embeddings) для текстовых входных данных, как и v5-text — тот же ввод, тот же вектор, побайтово. Вам не нужно переиндексировать или перестраивать какой-либо текстовый индекс. Чтобы начать поиск по изображениям, аудио и видео наряду с существующими текстовыми данными, просто создайте новый индекс с v5-omni и добавьте в него свой мультимодальный контент.

Создайте индекс semantic_text с v5-omni в качестве эндпоинта логического вывода (inference). EIS автоматически выбирает правильный LoRA-адаптер для индексации и поиска:

PUT multimodal-semantic-index
{
  "mappings": {
    "properties": {
      "content": {
        "type": "semantic_text",
        "inference_id": ".jina-embeddings-v5-omni-small"
      }
    }
  }
}

Добавляйте текст, изображения (в формате base64 data URI), аудио и видео в одно и то же поле и один и тот же индекс:

// Добавление текста
POST multimodal-semantic-index/_doc
{
  "content": "'Kraft Dinner' — это то, как канадцы называют макароны с сыром, приготовленные из набора."
}

// Добавление изображения (base64)
POST multimodal-semantic-index/_doc
{
  "content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}

Поиск по всем модальностям с помощью одного текстового запроса:

GET multimodal-semantic-index/_search
{
  "query": {
    "semantic": {
      "field": "content",
      "query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
    }
  }
}

tagJina Embedding API

curl https://api.jina.ai/v1/embeddings \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -d '{
    "model": "jina-embeddings-v5-omni-small",
    "task": "retrieval.query",
    "dimensions": 1024,
    "input": ["What does this image show?"],
    "images": ["data:image/png;base64,..."]
  }'

tagHugging Face

from sentence_transformers import SentenceTransformer
import torch

model = SentenceTransformer(
    "jinaai/jina-embeddings-v5-omni-small-retrieval",
    model_kwargs={"dtype": torch.bfloat16},
)

# Текстовые векторные модели (идентичны v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")

# Векторные модели для изображений
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)

# Кросс-модальное сходство
similarity = model.similarity(text_emb, img_emb)

tagОбучение

Основная идея заключается в композиции моделей с замороженным энкодером: берется мощная модель для создания векторных моделей текста, добавляются предварительно обученные визуальные и аудио-энкодеры, которые соединяются с помощью небольших обучаемых проекторов, после чего всё, кроме этих проекторов, замораживается. Обучаются только 0,35% от общего веса, что дает нам три свойства: (1) сохранение идентичности текста — основа не меняется, один и тот же ввод дает идентичный вывод; (2) эффективность обучения — обучение только проекторов происходит в 1,8–3,9 раза быстрее при использовании на 42–64% меньше видеопамяти; (3) модульность — компоненты могут загружаться независимо.

Training efficiency
Сравнение обучения только проекторов и полного обучения на 4x H100 GPU (размер пакета 256, 15 тыс. шагов). Обучение аудио-проектора особенно эффективно: в 3,2 раза быстрее для модели small (154 мин против 497 мин) и в 3,9 раза быстрее для модели nano (112 мин против 441 мин). Экономия памяти в 42–64% достигается за счет отсутствия необходимости хранить градиенты и состояния оптимизатора для замороженных энкодеров.

v5-omni наследует поддержку размерности Matryoshka от v5-text. Векторные модели изображений и аудио сохраняют большую часть качества при усечении, в то время как видео теряет качество сильнее при малых размерностях.

Radar summary
Резюме: профиль v5-omni по модальностям в сравнении с лучшими базовыми моделями. jina-embeddings-v5-omni-small с 1,57 млрд параметров конкурентоспособна в работе с текстом, изображениями и аудио; видео остается областью для дальнейшего улучшения.

tagЗаключение

Принято считать, что для мультимодальных векторных моделей требуется обучение всей модели целиком. Мы с этим не согласны. v5-omni замораживает текстовую основу, обучает 0,35% весов и соответствует по качеству моделям, которые в 5–7 раз больше. Урок: композиция лучше, чем переобучение. Мощный текстовый энкодер — это самая сложная часть; как только он у вас есть, добавление зрения и аудио через легкие проекторы практически не требует усилий.

Это важно для продакшена. Ваши существующие индексы v5-text остаются нетронутыми. Тот же запрос, тот же вектор, побайтово. Вы просто получаете поиск по изображениям, аудио и видео, не переиндексируя ни единого документа. Это и есть настоящий прорыв: мультимодальный поиск как обновление, которое можно просто установить, а не как проект по миграции.

jina-embeddings-v5-omni-small — это лучшая по производительности открытая мультимодальная модель для создания векторных моделей с количеством параметров менее 2 млрд. jina-embeddings-v5-omni-nano достигает этого при 0,9 млрд параметров. Обе модели уже доступны на Hugging Face, Jina Search Foundation API, а также в качестве нативного эндпоинта логического вывода в Elasticsearch.

Категории:
star
Избранное
пресс-релиз
rss_feed

Читать далее
август 03, 2026 • 11 минуты чтения
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
февраль 19, 2026 • 7 минуты чтения
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
декабрь 04, 2025 • 7 минуты чтения
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.