Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Вложения
copyright CC BY-NC 4.0
open_in_new Выпуск Пост

jina-embeddings-v5-omni-small

Мультимодальные встраивания для текста, изображений, аудио, видео и PDF-файлов.
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2026-05-07
Вход
abc
Текст
image
Изображение
audiotrack
Аудио
videocam
Видео
picture_as_pdf
PDF
arrow_forward
Выход
more_horiz
Вектор
Размерности Matryoshka help_outline
32
64
128
256
512
768
1024
Подробности модели
Параметры: 1.7B
Длина входного токена: 32K
Выходной размер: 1024
Базовая модель help_outline
open_in_new
jina-embeddings-v5-text-small
Обученные языки help_outline
32 языки
Поддерживаемые языки help_outline
93 языки
Квантования help_outline
GGUF
Поддержка Apple Silicon help_outline
MLX
Похожие модели
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
Поддерживаемые задачи
search Извлечение
compare_arrows Сопоставление текста
bubble_chart Кластеризация
label Классификация
Доступно через
Elastic Inference Service
API Джина
AWS SageMaker
Hugging Face
Air-gapped
График ввода-вывода 1

Текст

jina-embeddings-v5-omni-small

Изображение

Задача

Вектор

График ввода-вывода 2

Текст

jina-embeddings-v5-omni-small

Аудио

Задача

Вектор

График ввода-вывода 3

Текст

jina-embeddings-v5-omni-small

Видео

Задача

Вектор

График ввода-вывода 4

несколько

Вектор

Текст

jina-embeddings-v5-omni-small

PDF

Задача

Pareto fronthelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
30M100M300M1B3.0B10B20406080bekko-embedding-v1-a25mbge-large-enbge-large-en-v1.5bge-m3bge-small-en-v1.5BOOM-4B-v1e5-base-v2e5-mistral-7b-instructF2LLM-v2-14BF2LLM-v2-330MF2LLM-v2-4BF2LLM-v2-80Mgranite-embedding-small…GritLM-7Bjina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-omni…jina-embeddings-v5-text…jina-embeddings-v5-text…LaBSEMoD-EmbeddingNemotron-3-Embed-8BNV-Embed-v2Octen-Embedding-0.6BOcten-Embedding-4BOcten-Embedding-8Bparaphrase-multilingual…paraphrase-multilingual…PIXIE-Rune-v1.0potion-multilingual-128Msnowflake-arctic-embed-…UAE-Large-V1voyage-4-nanoParameters (log)nDCG@10
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Распределение значенийhelp_outline
AUC 0.8269
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
Связанные10.9%
Сложный отрицательный2.1%
Несвязанные0.9%
Рекомендуемые пороги
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
сбалансированный · 0.697
AUC
0.8269
Потолок шума
0.855
Обрыв полноты
0.566
Измерено пар
119 / 11k
Эта модель использует ту же текстовую башню, что и jina-embeddings-v5-text-small. Приведённые распределения принадлежат ей и совпадают с точностью передачи fp16.
Компоненты вектораhelp_outline
-0.160.010.18
σ 0.0313 · 244k значений
Геометрия эмбеддинговhelp_outline
01024
Среднее по измерениям, наведите для диапазона
Уровень шума
0.300
Эффективных изм.
70 / 1024
Усечение размерностиhelp_outline
32641282565121024
text-matching · Порог в зависимости от запрошенной размерности
Языковые парыhelp_outline
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.024
Выберите модели для сравнения
Публикации (1)
SIGIR 2026
май 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Обзор

jina-embeddings-v5-omni-small (~1,74 млрд параметров) — это мультимодальная модель эмбеддингов, которая принимает текст, изображения, видео и аудио и создает эмбеддинги в общем векторном пространстве, согласованном с jina-embeddings-v5-text-small. Вы можете индексировать текстом и выполнять запросы с использованием любой модальности, или наоборот, без переиндексации. Текстовая основа и все четыре специализированных адаптера LoRA (поиск, сопоставление текста, кластеризация, классификация) замораживаются во время мультимодального обучения, поэтому выходные данные только с текстом побитово идентичны данным jina-embeddings-v5-text-small. Модель создает 1024-мерные эмбеддинги с усечением Matryoshka до 32 измерений и поддерживает длину контекста 32K токенов.

Методы

Обучение проводилось на третьем этапе, расширяющем jina-embeddings-v5-text-small. Текстовая архитектура и все четыре специализированных адаптера LoRA были зафиксированы; заново обучались только кросс-модальные проекторы. Для обработки изображений и видео (32 равномерно дискретизированных кадра) использовался графический кодировщик SigLIP2 So400m. Для обработки аудиовхода использовался аудиокодировщик Whisper-large-v3. Страницы PDF-файлов отображались как изображения и обрабатывались через графический канал. В процессе обучения использовалась контрастная функция потерь с кросс-модальными жесткими отрицаниями для выравнивания визуальных и аудиопредставлений с существующим пространством встраивания текста.

Производительность

Производительность при обработке только текста идентична производительности jina-embeddings-v5-text-small — текстовая основа и адаптеры LoRA остаются неизменными во время мультимодального обучения. При кросс-модальном поиске модель демонстрирует высокую согласованность между задачами текст-изображение, текст-аудио и текст-видео. Поиск страниц PDF осуществляется через путь обработки изображений. Модель omni-small предлагает наилучший компромисс между точностью и эффективностью среди мультимодальных моделей встраивания Jina для развертывания на сервере.

Руководство

Те же четыре адаптера LoRA, что и в v5-text-small: retrieval, text-matching, clustering и classification. Для мультимодальных входных данных через API передавайте URL-адреса изображений, аудиофайлов, видеофайлов или PDF-файлов напрямую — модель направляет каждую модальность через соответствующий кодировщик. Поддерживаемые аудиоформаты: WAV, MP3, FLAC, OGG, M4A и Opus. Видеовходы обрабатываются как 32 равномерно выбранных кадра. Свободно смешивайте модальности в одном пакете: пространство эмбеддингов используется совместно для всех модальностей. Используйте косинусное сходство для сравнения. Поддерживается усечение Matryoshka с 1024 до 32 измерений. Эмбеддинги только для текста полностью совместимы с jina-embeddings-v5-text-small — при обновлении переиндексация не требуется.
Блоги, в которых упоминается эта модель
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.