Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Эмбеддинги
copyright CC BY-NC 4.0
open_in_new Пост о релизе

jina-embeddings-v5-omni-small

Мультимодальные эмбеддинга для текста, изображений, аудио, видео и PDF-файлов.
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2026-05-07
Вход
abc
Текст
image
Изображение
audiotrack
Аудио
videocam
Видео
picture_as_pdf
PDF
arrow_forward
Выход
more_horiz
Вектор
Размерности Matryoshka help_outline
32
64
128
256
512
768
1024
Подробности модели
Параметры: 1.7B
Длина входного токена: 32K
Выходной размер: 1024
Базовая модель help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
Обученные языки help_outline
32 языки
Поддерживаемые языки help_outline
93 языки
Квантования help_outline
GGUF
Поддержка Apple Silicon help_outline
MLX
Похожие модели
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Поддерживаемые задачи
search Поиск
compare_arrows Сопоставление текста
bubble_chart Кластеризация
label Классификация
Доступно через
Elastic Inference Service
API Jina AI
AWS SageMaker
Hugging Face
Air-gapped
График ввода-вывода 1

Текст

jina-embeddings-v5-omni-small

Изображение

Задача

Вектор

График ввода-вывода 2

Текст

jina-embeddings-v5-omni-small

Аудио

Задача

Вектор

График ввода-вывода 3

Текст

jina-embeddings-v5-omni-small

Видео

Задача

Вектор

График ввода-вывода 4

несколько

Вектор

Текст

jina-embeddings-v5-omni-small

PDF

Задача

Парето-фронтhelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
MAEB
49.96
Параметры
1.6B
Ранг по баллу
5 / 21
Парето-фронт
На фронте
Распределение значенийhelp_outline
AUC 0.8269
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Связанные10.9%
Сложный отрицательный2.1%
Несвязанные0.9%
Рекомендуемые пороги
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
сбалансированный · 0.697
AUC
0.8269
Потолок шума
0.855
Обрыв полноты
0.566
Измерено пар
119 / 11k
Эта модель использует ту же текстовую башню, что и jina-embeddings-v5-text-small. Приведённые распределения принадлежат ей и совпадают с точностью передачи fp16.
Компоненты вектораhelp_outline
-0.160.010.18
σ 0.0313 · 244k значений
Геометрия эмбеддинговhelp_outline
01024
Среднее по измерениям, наведите для диапазона
Уровень шума
0.300
Эффективных изм.
70 / 1024
Усечение размерностиhelp_outline
32641282565121024
text-matching · Порог в зависимости от запрошенной размерности
Языковые парыhelp_outline
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.024
Выберите модели для сравнения
Публикации (1)
SIGIR 2026
май 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Обзор

jina-embeddings-v5-omni-small — мультимодальная embedding-модель примерно на 1,74B параметров, принимающая текст, изображения, видео, аудио и PDF и формирующая эмбеддинги в общем 1024-мерном векторном пространстве. Это модель эмбеддингов по умолчанию для API Jina, и она обеспечивает наилучший баланс точности и эффективности среди мультимодальных embedding-моделей Jina. Выводы только для текста побитово идентичны jina-embeddings-v5-text-small, что позволяет бесшовно мигрировать с текстового режима на мультимодальный без реиндексации.

Методы

Модель обучается на третьей стадии, расширяющей jina-embeddings-v5-text-small. Во время мультимодального обучения текстовый backbone Qwen3-0,6B-Base и все четыре task-specific LoRA-адаптера замораживаются; обучаются заново только кросс-модальные проекторы. Vision-энкодер SigLIP2 Large обрабатывает изображения и видео (32 равномерно выбранных кадра на видео). Audio-энкодер Whisper-large-v3 обрабатывает аудио-вход. Страницы PDF рендерятся как изображения и обрабатываются через визуальный путь. Обучение использует контрастивный loss с кросс-модальными жёсткими негативами для выравнивания визуальных и аудио-представлений с существующим текстовым пространством эмбеддингов. Вывод в 1024 измерений поддерживает обрезку Matryoshka до 32 измерений. 32K-токенное контекстное окно покрывает текстовый вход. Модель поддерживает квантованный и MLX инференс для Apple Silicon.

Производительность

Производительность только для текста побитово идентична jina-embeddings-v5-text-small (67,0 MMTEB в среднем на уровне задач, 71,7 английский MTEB) — текстовый backbone и LoRA-адаптеры не затрагиваются при мультимодальном обучении. В кросс-модальном поиске модель демонстрирует сильное выравнивание на задачах text-image, text-audio и text-video. Поиск страниц PDF обрабатывается через визуальный путь. Модель omni-small обеспечивает наилучший баланс точности и эффективности среди мультимодальных embedding-моделей Jina для серверного развёртывания, причём эмбеддинги в 1024 измерений обладают бо́льшей дискриминирующей силой, чем 768-мерный вариант omni-nano.

Руководство

Выберите подходящий LoRA-адаптер: retrieval, text-matching, clustering или classification. Для мультимодальных входов через API передавайте напрямую URL изображений, URL аудиофайлов, URL видеофайлов или URL PDF — модель направляет каждую модальность через соответствующий энкодер. Поддерживаемые аудиоформаты включают WAV, MP3, FLAC, OGG, M4A и Opus. Видеовходы обрабатываются как 32 равномерно выбранных кадра. Модальности можно свободно смешивать в рамках одного батча: пространство эмбеддингов общее для всех модальностей. Используйте косинусное сходство для сравнения. Обрезка Matryoshka с 1024 до 32 измерений поддерживается. Текстовые эмбеддинги drop-in совместимы с jina-embeddings-v5-text-small — при обновлении реиндексация не нужна. Для edge-развёртывания без GPU используйте вместо этого jina-embeddings-v5-omni-nano.

Блоги, в которых упоминается эта модель
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.