График ввода-вывода 1

Текст

jina-embeddings-v5-omni-small

Изображение

Задача

Вектор

График ввода-вывода 2

Текст

jina-embeddings-v5-omni-small

Аудио

Задача

Вектор

График ввода-вывода 3

Текст

jina-embeddings-v5-omni-small

Видео

Задача

Вектор

График ввода-вывода 4

несколько

Вектор

Текст

jina-embeddings-v5-omni-small

PDF

Задача

Парето-фронт
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
MAEB
49.96
Параметры
1.6B
Ранг по баллу
5 / 21
Парето-фронт
На фронте
Распределение значений
AUC 0.8269
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Связанные10.9%
Сложный отрицательный2.1%
Несвязанные0.9%
Рекомендуемые пороги
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
сбалансированный · 0.697
AUC
0.8269
Потолок шума
0.855
Обрыв полноты
0.566
Измерено пар
119 / 11k
Эта модель использует ту же текстовую башню, что и jina-embeddings-v5-text-small. Приведённые распределения принадлежат ей и совпадают с точностью передачи fp16.
Компоненты вектора
-0.160.010.18
σ 0.0313 · 244k значений
Геометрия эмбеддингов
01024
Среднее по измерениям, наведите для диапазона
Уровень шума
0.300
Эффективных изм.
70 / 1024
Усечение размерности
32641282565121024
text-matching · Порог в зависимости от запрошенной размерности
Языковые пары
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.024
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embeddings-v5-omni-small — мультимодальная embedding-модель примерно на 1,74B параметров, принимающая текст, изображения, видео, аудио и PDF и формирующая эмбеддинги в общем 1024-мерном векторном пространстве. Это модель эмбеддингов по умолчанию для API Jina, и она обеспечивает наилучший баланс точности и эффективности среди мультимодальных embedding-моделей Jina. Выводы только для текста побитово идентичны jina-embeddings-v5-text-small, что позволяет бесшовно мигрировать с текстового режима на мультимодальный без реиндексации.

Методы

Модель обучается на третьей стадии, расширяющей jina-embeddings-v5-text-small. Во время мультимодального обучения текстовый backbone Qwen3-0,6B-Base и все четыре task-specific LoRA-адаптера замораживаются; обучаются заново только кросс-модальные проекторы. Vision-энкодер SigLIP2 Large обрабатывает изображения и видео (32 равномерно выбранных кадра на видео). Audio-энкодер Whisper-large-v3 обрабатывает аудио-вход. Страницы PDF рендерятся как изображения и обрабатываются через визуальный путь. Обучение использует контрастивный loss с кросс-модальными жёсткими негативами для выравнивания визуальных и аудио-представлений с существующим текстовым пространством эмбеддингов. Вывод в 1024 измерений поддерживает обрезку Matryoshka до 32 измерений. 32K-токенное контекстное окно покрывает текстовый вход. Модель поддерживает квантованный и MLX инференс для Apple Silicon.

Производительность

Производительность только для текста побитово идентична jina-embeddings-v5-text-small (67,0 MMTEB в среднем на уровне задач, 71,7 английский MTEB) — текстовый backbone и LoRA-адаптеры не затрагиваются при мультимодальном обучении. В кросс-модальном поиске модель демонстрирует сильное выравнивание на задачах text-image, text-audio и text-video. Поиск страниц PDF обрабатывается через визуальный путь. Модель omni-small обеспечивает наилучший баланс точности и эффективности среди мультимодальных embedding-моделей Jina для серверного развёртывания, причём эмбеддинги в 1024 измерений обладают бо́льшей дискриминирующей силой, чем 768-мерный вариант omni-nano.

Руководство

Выберите подходящий LoRA-адаптер: retrieval, text-matching, clustering или classification. Для мультимодальных входов через API передавайте напрямую URL изображений, URL аудиофайлов, URL видеофайлов или URL PDF — модель направляет каждую модальность через соответствующий энкодер. Поддерживаемые аудиоформаты включают WAV, MP3, FLAC, OGG, M4A и Opus. Видеовходы обрабатываются как 32 равномерно выбранных кадра. Модальности можно свободно смешивать в рамках одного батча: пространство эмбеддингов общее для всех модальностей. Используйте косинусное сходство для сравнения. Обрезка Matryoshka с 1024 до 32 измерений поддерживается. Текстовые эмбеддинги drop-in совместимы с jina-embeddings-v5-text-small — при обновлении реиндексация не нужна. Для edge-развёртывания без GPU используйте вместо этого jina-embeddings-v5-omni-nano.

Блоги, в которых упоминается эта модель