График ввода-вывода 1
График ввода-вывода 2
График ввода-вывода 3
График ввода-вывода 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
Распределение значенийhelp_outlineAUC 0.8269
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
Связанные10.9%
Сложный отрицательный2.1%
Несвязанные0.9%
Рекомендуемые пороги
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
сбалансированный · 0.697
AUC
0.8269
Потолок шума
0.855
Обрыв полноты
0.566
Измерено пар
119 / 11k
Эта модель использует ту же текстовую башню, что и jina-embeddings-v5-text-small. Приведённые распределения принадлежат ей и совпадают с точностью передачи fp16.
Компоненты вектораhelp_outline
σ 0.0313 · 244k значений
Геометрия эмбеддинговhelp_outline
Среднее по измерениям, наведите для диапазона
Уровень шума
0.300
Эффективных изм.
70 / 1024
Усечение размерностиhelp_outline
text-matching · Порог в зависимости от запрошенной размерности
Языковые парыhelp_outline
Разброс порога между парами: 0.024
Выберите модели для сравнения
Публикации (1)
Обзор
jina-embeddings-v5-omni-small (~1,74 млрд параметров) — это мультимодальная модель эмбеддингов, которая принимает текст, изображения, видео и аудио и создает эмбеддинги в общем векторном пространстве, согласованном с jina-embeddings-v5-text-small. Вы можете индексировать текстом и выполнять запросы с использованием любой модальности, или наоборот, без переиндексации. Текстовая основа и все четыре специализированных адаптера LoRA (поиск, сопоставление текста, кластеризация, классификация) замораживаются во время мультимодального обучения, поэтому выходные данные только с текстом побитово идентичны данным jina-embeddings-v5-text-small. Модель создает 1024-мерные эмбеддинги с усечением Matryoshka до 32 измерений и поддерживает длину контекста 32K токенов.
Методы
Обучение проводилось на третьем этапе, расширяющем jina-embeddings-v5-text-small. Текстовая архитектура и все четыре специализированных адаптера LoRA были зафиксированы; заново обучались только кросс-модальные проекторы. Для обработки изображений и видео (32 равномерно дискретизированных кадра) использовался графический кодировщик SigLIP2 So400m. Для обработки аудиовхода использовался аудиокодировщик Whisper-large-v3. Страницы PDF-файлов отображались как изображения и обрабатывались через графический канал. В процессе обучения использовалась контрастная функция потерь с кросс-модальными жесткими отрицаниями для выравнивания визуальных и аудиопредставлений с существующим пространством встраивания текста.
Производительность
Производительность при обработке только текста идентична производительности jina-embeddings-v5-text-small — текстовая основа и адаптеры LoRA остаются неизменными во время мультимодального обучения. При кросс-модальном поиске модель демонстрирует высокую согласованность между задачами текст-изображение, текст-аудио и текст-видео. Поиск страниц PDF осуществляется через путь обработки изображений. Модель omni-small предлагает наилучший компромисс между точностью и эффективностью среди мультимодальных моделей встраивания Jina для развертывания на сервере.
Руководство
Те же четыре адаптера LoRA, что и в v5-text-small: retrieval, text-matching, clustering и classification. Для мультимодальных входных данных через API передавайте URL-адреса изображений, аудиофайлов, видеофайлов или PDF-файлов напрямую — модель направляет каждую модальность через соответствующий кодировщик. Поддерживаемые аудиоформаты: WAV, MP3, FLAC, OGG, M4A и Opus. Видеовходы обрабатываются как 32 равномерно выбранных кадра. Свободно смешивайте модальности в одном пакете: пространство эмбеддингов используется совместно для всех модальностей. Используйте косинусное сходство для сравнения. Поддерживается усечение Matryoshka с 1024 до 32 измерений. Эмбеддинги только для текста полностью совместимы с jina-embeddings-v5-text-small — при обновлении переиндексация не требуется.
Блоги, в которых упоминается эта модель



