График ввода-вывода 1

Текст

jina-embeddings-v5-omni-nano

Изображение

Задача

Вектор

График ввода-вывода 2

Текст

jina-embeddings-v5-omni-nano

Аудио

Задача

Вектор

График ввода-вывода 3

Текст

jina-embeddings-v5-omni-nano

Видео

Задача

Вектор

График ввода-вывода 4

несколько

Вектор

Текст

jina-embeddings-v5-omni-nano

PDF

Задача

Парето-фронт
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
MAEB
49.69
Параметры
986M
Ранг по баллу
6 / 21
Парето-фронт
На фронте
Распределение значений
AUC 0.8242
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
Связанные20.2%
Сложный отрицательный1.7%
Несвязанные1.1%
Рекомендуемые пороги
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
сбалансированный · 0.678
AUC
0.8242
Потолок шума
0.840
Обрыв полноты
0.557
Измерено пар
119 / 11k
Эта модель использует ту же текстовую башню, что и jina-embeddings-v5-text-nano. Приведённые распределения принадлежат ей и совпадают с точностью передачи fp16.
Компоненты вектора
-0.180.000.19
σ 0.0361 · 183k значений
Геометрия эмбеддингов
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.288
Эффективных изм.
69 / 768
Усечение размерности
3264128256512768
text-matching · Порог в зависимости от запрошенной размерности
Языковые пары
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.027
Выберите модели для сравнения
Публикации (1)

Обзор

jina-embeddings-v5-omni-nano — мультимодальная embedding-модель примерно на 1,04B параметров, принимающая текст, изображения, видео и аудио и формирующая эмбеддинги в общем векторном пространстве. Это компактный вариант семейства v5-omni, рассчитанный на edge и потребительское железо, где нет GPU. Выводы только для текста побитово идентичны jina-embeddings-v5-text-nano, что делает его drop-in обновлением с текстового режима на мультимодальный без реиндексации.

Методы

Модель расширяет jina-embeddings-v5-text-nano мультимодальными возможностями через третью стадию обучения. Текстовый backbone EuroBERT-210M и все четыре task-specific LoRA-адаптера замораживаются; обучаются заново только кросс-модальные проекторы. Vision-энкодер SigLIP2 Base обрабатывает изображения и видео (32 равномерно выбранных кадра на видео). Audio-энкодер Whisper-large-v3 обрабатывает аудио-вход. Страницы PDF рендерятся как изображения и обрабатываются через визуальный путь. Обучение использует контрастивный loss с кросс-модальными жёсткими негативами для выравнивания визуальных и аудио-представлений с существующим текстовым пространством эмбеддингов. Пространство вывода в 768 измерений поддерживает обрезку Matryoshka до 32 измерений. 8K-токенное контекстное окно покрывает текстовый вход; входы изображения и аудио обрабатываются через свои соответствующие энкодеры.

Производительность

Производительность только для текста побитово идентична jina-embeddings-v5-text-nano (65,5 MMTEB в среднем на уровне задач, 71,0 английский MTEB). Мультимодальная производительность немного уступает jina-embeddings-v5-omni-small из-за более узкого 768-мерного пространства эмбеддингов (против 1024) и меньшего текстового backbone, но сохраняет сильное кросс-модальное выравнивание на поиске text-image, text-audio и text-video. Модель оптимизирована для CPU и edge-устройств, где более крупная omni-small не может работать эффективно. Качество кросс-модального поиска конкурентоспособно для её класса размера.

Руководство

Тот же паттерн использования, что и у jina-embeddings-v5-omni-small: выберите подходящий LoRA-адаптер (retrieval, text-matching, clustering, classification) и передавайте напрямую URL изображений, URL аудиофайлов, URL видеофайлов или URL PDF через API — модель направляет каждую модальность через соответствующий энкодер. Поддерживаемые аудиоформаты: WAV, MP3, FLAC, OGG, M4A, Opus. Видеовходы обрабатываются как 32 равномерно выбранных кадра. Модальности можно свободно смешивать в рамках одного батча; пространство эмбеддингов общее для всех модальностей. Используйте косинусное сходство для сравнения. Обрезка Matryoshka с 768 до 32 измерений поддерживается. Текстовые эмбеддинги drop-in совместимы с jina-embeddings-v5-text-nano — при обновлении реиндексация не нужна. Для серверного развёртывания, требующего большей точности, используйте jina-embeddings-v5-omni-small (1024 измерений, более крупный backbone).

Блоги, в которых упоминается эта модель