Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Эмбеддинги
copyright CC BY-NC 4.0
open_in_new Пост о релизе

jina-embeddings-v5-omni-nano

Компактные мультимодальные эмбеддинга для развертывания на периферии сети
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2026-05-07
Вход
abc
Текст
image
Изображение
audiotrack
Аудио
videocam
Видео
picture_as_pdf
PDF
arrow_forward
Выход
more_horiz
Вектор
Размерности Matryoshka help_outline
32
64
128
256
512
768
Подробности модели
Параметры: 1.0B
Длина входного токена: 8K
Выходной размер: 768
Базовая модель help_outline
link
jina-embeddings-v5-text-nano
open_in_new
SigLIP2 Base
open_in_new
Whisper-large-v3
Обученные языки help_outline
32 языки
Поддерживаемые языки help_outline
108 языки
Квантования help_outline
GGUF
Поддержка Apple Silicon help_outline
MLX
Похожие модели
link
jina-embeddings-v5-omni-small
link
jina-embeddings-v5-text-nano
link
jina-embeddings-v3
link
jina-clip-v2
Поддерживаемые задачи
search Поиск
compare_arrows Сопоставление текста
bubble_chart Кластеризация
label Классификация
Доступно через
Elastic Inference Service
API Jina AI
AWS SageMaker
Hugging Face
Air-gapped
График ввода-вывода 1

Текст

jina-embeddings-v5-omni-nano

Изображение

Задача

Вектор

График ввода-вывода 2

Текст

jina-embeddings-v5-omni-nano

Аудио

Задача

Вектор

График ввода-вывода 3

Текст

jina-embeddings-v5-omni-nano

Видео

Задача

Вектор

График ввода-вывода 4

несколько

Вектор

Текст

jina-embeddings-v5-omni-nano

PDF

Задача

Парето-фронтhelp_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…Параметры (лог)score
Эта модель
На фронте
Jina AI
Другие
MAEB
49.69
Параметры
986M
Ранг по баллу
6 / 21
Парето-фронт
На фронте
Распределение значенийhelp_outline
AUC 0.8242
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
Связанные20.2%
Сложный отрицательный1.7%
Несвязанные1.1%
Рекомендуемые пороги
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
сбалансированный · 0.678
AUC
0.8242
Потолок шума
0.840
Обрыв полноты
0.557
Измерено пар
119 / 11k
Эта модель использует ту же текстовую башню, что и jina-embeddings-v5-text-nano. Приведённые распределения принадлежат ей и совпадают с точностью передачи fp16.
Компоненты вектораhelp_outline
-0.180.000.19
σ 0.0361 · 183k значений
Геометрия эмбеддинговhelp_outline
0768
Среднее по измерениям, наведите для диапазона
Уровень шума
0.288
Эффективных изм.
69 / 768
Усечение размерностиhelp_outline
3264128256512768
text-matching · Порог в зависимости от запрошенной размерности
Языковые парыhelp_outline
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.027
Выберите модели для сравнения
Публикации (1)
SIGIR 2026
май 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

Обзор

jina-embeddings-v5-omni-nano — мультимодальная embedding-модель примерно на 1,04B параметров, принимающая текст, изображения, видео и аудио и формирующая эмбеддинги в общем векторном пространстве. Это компактный вариант семейства v5-omni, рассчитанный на edge и потребительское железо, где нет GPU. Выводы только для текста побитово идентичны jina-embeddings-v5-text-nano, что делает его drop-in обновлением с текстового режима на мультимодальный без реиндексации.

Методы

Модель расширяет jina-embeddings-v5-text-nano мультимодальными возможностями через третью стадию обучения. Текстовый backbone EuroBERT-210M и все четыре task-specific LoRA-адаптера замораживаются; обучаются заново только кросс-модальные проекторы. Vision-энкодер SigLIP2 Base обрабатывает изображения и видео (32 равномерно выбранных кадра на видео). Audio-энкодер Whisper-large-v3 обрабатывает аудио-вход. Страницы PDF рендерятся как изображения и обрабатываются через визуальный путь. Обучение использует контрастивный loss с кросс-модальными жёсткими негативами для выравнивания визуальных и аудио-представлений с существующим текстовым пространством эмбеддингов. Пространство вывода в 768 измерений поддерживает обрезку Matryoshka до 32 измерений. 8K-токенное контекстное окно покрывает текстовый вход; входы изображения и аудио обрабатываются через свои соответствующие энкодеры.

Производительность

Производительность только для текста побитово идентична jina-embeddings-v5-text-nano (65,5 MMTEB в среднем на уровне задач, 71,0 английский MTEB). Мультимодальная производительность немного уступает jina-embeddings-v5-omni-small из-за более узкого 768-мерного пространства эмбеддингов (против 1024) и меньшего текстового backbone, но сохраняет сильное кросс-модальное выравнивание на поиске text-image, text-audio и text-video. Модель оптимизирована для CPU и edge-устройств, где более крупная omni-small не может работать эффективно. Качество кросс-модального поиска конкурентоспособно для её класса размера.

Руководство

Тот же паттерн использования, что и у jina-embeddings-v5-omni-small: выберите подходящий LoRA-адаптер (retrieval, text-matching, clustering, classification) и передавайте напрямую URL изображений, URL аудиофайлов, URL видеофайлов или URL PDF через API — модель направляет каждую модальность через соответствующий энкодер. Поддерживаемые аудиоформаты: WAV, MP3, FLAC, OGG, M4A, Opus. Видеовходы обрабатываются как 32 равномерно выбранных кадра. Модальности можно свободно смешивать в рамках одного батча; пространство эмбеддингов общее для всех модальностей. Используйте косинусное сходство для сравнения. Обрезка Matryoshka с 768 до 32 измерений поддерживается. Текстовые эмбеддинги drop-in совместимы с jina-embeddings-v5-text-nano — при обновлении реиндексация не нужна. Для серверного развёртывания, требующего большей точности, используйте jina-embeddings-v5-omni-small (1024 измерений, более крупный backbone).

Блоги, в которых упоминается эта модель
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.