Обзор
jina-embeddings-v5-omni-nano — мультимодальная embedding-модель примерно на 1,04B параметров, принимающая текст, изображения, видео и аудио и формирующая эмбеддинги в общем векторном пространстве. Это компактный вариант семейства v5-omni, рассчитанный на edge и потребительское железо, где нет GPU. Выводы только для текста побитово идентичны jina-embeddings-v5-text-nano, что делает его drop-in обновлением с текстового режима на мультимодальный без реиндексации.
Методы
Модель расширяет jina-embeddings-v5-text-nano мультимодальными возможностями через третью стадию обучения. Текстовый backbone EuroBERT-210M и все четыре task-specific LoRA-адаптера замораживаются; обучаются заново только кросс-модальные проекторы. Vision-энкодер SigLIP2 Base обрабатывает изображения и видео (32 равномерно выбранных кадра на видео). Audio-энкодер Whisper-large-v3 обрабатывает аудио-вход. Страницы PDF рендерятся как изображения и обрабатываются через визуальный путь. Обучение использует контрастивный loss с кросс-модальными жёсткими негативами для выравнивания визуальных и аудио-представлений с существующим текстовым пространством эмбеддингов. Пространство вывода в 768 измерений поддерживает обрезку Matryoshka до 32 измерений. 8K-токенное контекстное окно покрывает текстовый вход; входы изображения и аудио обрабатываются через свои соответствующие энкодеры.
Производительность
Производительность только для текста побитово идентична jina-embeddings-v5-text-nano (65,5 MMTEB в среднем на уровне задач, 71,0 английский MTEB). Мультимодальная производительность немного уступает jina-embeddings-v5-omni-small из-за более узкого 768-мерного пространства эмбеддингов (против 1024) и меньшего текстового backbone, но сохраняет сильное кросс-модальное выравнивание на поиске text-image, text-audio и text-video. Модель оптимизирована для CPU и edge-устройств, где более крупная omni-small не может работать эффективно. Качество кросс-модального поиска конкурентоспособно для её класса размера.
Руководство
Тот же паттерн использования, что и у jina-embeddings-v5-omni-small: выберите подходящий LoRA-адаптер (retrieval, text-matching, clustering, classification) и передавайте напрямую URL изображений, URL аудиофайлов, URL видеофайлов или URL PDF через API — модель направляет каждую модальность через соответствующий энкодер. Поддерживаемые аудиоформаты: WAV, MP3, FLAC, OGG, M4A, Opus. Видеовходы обрабатываются как 32 равномерно выбранных кадра. Модальности можно свободно смешивать в рамках одного батча; пространство эмбеддингов общее для всех модальностей. Используйте косинусное сходство для сравнения. Обрезка Matryoshka с 768 до 32 измерений поддерживается. Текстовые эмбеддинги drop-in совместимы с jina-embeddings-v5-text-nano — при обновлении реиндексация не нужна. Для серверного развёртывания, требующего большей точности, используйте jina-embeddings-v5-omni-small (1024 измерений, более крупный backbone).



