

Мы выпускаем jina-embeddings-v5-omni, расширяя наши векторные модели v5-text поддержкой изображений, аудио и видео. Обе модели используют ту же замороженную текстовую основу, что и v5-text, а это означает, что векторные представления текста идентичны — переиндексация не требуется. jina-embeddings-v5-omni-small набирает в среднем 53,93 балла по четырем модальностям, что соответствует LCO-7B (54,43) при в 5,7 раза меньшем количестве параметров, в то время как jina-embeddings-v5-omni-nano обеспечивает конкурентоспособный поиск документов всего при 0,95 млрд параметров.




tagАрхитектура
v5-omni сохраняет основу v5-text полностью замороженной и добавляет предварительно обученные визуальные и аудио-энкодеры, связанные через небольшие обучаемые проекторы:
- Зрение: визуальные энкодеры Qwen3.5 (адаптированные из SigLIP2) с пространственным объединением 2x2 (уменьшение количества токенов в 4 раза). Мы замораживаем всё, кроме финального проекционного слоя (
fc_vision_2), который заменяем случайным образом инициализированным слоем, проецирующим данные в скрытую размерность текстовой основы. - Аудио: энкодер Qwen2.5-Omni (адаптирован из Whisper-large-v3). Единственный случайным образом инициализированный слой
fc_audioпроецирует 1280-мерный вывод в текстовую основу. - Видео: обрабатывается как последовательность визуальных кадров, при необходимости предваряемая извлеченным аудиосегментом.
Модель наследует четыре специфичных для задач адаптера LoRA от v5-text (поиск, сопоставление текста, классификация, кластеризация) и обучает отдельные веса проектора для каждого варианта задачи. Архитектура полностью модульная: развертывание только для текста не загружает веса зрения или аудио (идентично объему v5-text), только для изображений — пропускает аудио, полный omni — загружает всё.

| Характеристика | jina-embeddings-v5-omni-small | jina-embeddings-v5-omni-nano |
|---|---|---|
| Базовая текстовая модель | jina-embeddings-v5-text-small (Qwen3-0.6B) | jina-embeddings-v5-text-nano (EuroBERT-210m) |
| Общее количество параметров | ~1,56 млрд | ~1,04 млрд |
| Модальности | Текст, изображение, аудио, видео, PDF | Текст, изображение, аудио, видео, PDF |
| Размерности векторов | 1024 | 768 |
| Размерности Matryoshka | 32, 64, 128, 256, 512, 768, 1024 | 32, 64, 128, 256, 512, 768 |
| Максимальная длина последовательности | 32768词元 | 8192词元 |
| Визуальный энкодер | Qwen3.5-2B ViT (SigLIP2) | SigLIP2 Base |
| Аудио-энкодер | Whisper-large-v3 | Whisper-large-v3 |
| Задачи | поиск, сопоставление текста, классификация, кластеризация | поиск, сопоставление текста, классификация, кластеризация |
| Совместимость с текстом | Идентично jina-embeddings-v5-text-small | Идентично jina-embeddings-v5-text-nano |
| Обучаемые параметры | ~18 млн проекторов (0,35%) | ~7 млн проекторов (0,35%) |
| Пулинг | Last-token | Last-token |
| Лицензия | CC BY-NC 4.0 | CC BY-NC 4.0 |
tagНачало работы
tagElasticsearch (Elastic Inference Service)
Если вы уже используете jina-embeddings-v5-text в Elasticsearch, ваши существующие текстовые индексы будут работать с v5-omni без каких-либо дополнительных настроек. Модели omni генерируют идентичные векторные модели (embeddings) для текстовых входных данных, как и v5-text — тот же ввод, тот же вектор, побайтово. Вам не нужно переиндексировать или перестраивать какой-либо текстовый индекс. Чтобы начать поиск по изображениям, аудио и видео наряду с существующими текстовыми данными, просто создайте новый индекс с v5-omni и добавьте в него свой мультимодальный контент.
Создайте индекс semantic_text с v5-omni в качестве эндпоинта логического вывода (inference). EIS автоматически выбирает правильный LoRA-адаптер для индексации и поиска:
PUT multimodal-semantic-index
{
"mappings": {
"properties": {
"content": {
"type": "semantic_text",
"inference_id": ".jina-embeddings-v5-omni-small"
}
}
}
}Добавляйте текст, изображения (в формате base64 data URI), аудио и видео в одно и то же поле и один и тот же индекс:
// Добавление текста
POST multimodal-semantic-index/_doc
{
"content": "'Kraft Dinner' — это то, как канадцы называют макароны с сыром, приготовленные из набора."
}
// Добавление изображения (base64)
POST multimodal-semantic-index/_doc
{
"content": "data:image/png;base64,iVBORw0KGgoAAAAN..."
}Поиск по всем модальностям с помощью одного текстового запроса:
GET multimodal-semantic-index/_search
{
"query": {
"semantic": {
"field": "content",
"query": "Was bedeutet 'Kraft Dinner' für Kanadier?"
}
}
}tagJina Embedding API
curl https://api.jina.ai/v1/embeddings \
-H "Content-Type: application/json" \
-H "Authorization: Bearer YOUR_API_KEY" \
-d '{
"model": "jina-embeddings-v5-omni-small",
"task": "retrieval.query",
"dimensions": 1024,
"input": ["What does this image show?"],
"images": ["data:image/png;base64,..."]
}'tagHugging Face
from sentence_transformers import SentenceTransformer
import torch
model = SentenceTransformer(
"jinaai/jina-embeddings-v5-omni-small-retrieval",
model_kwargs={"dtype": torch.bfloat16},
)
# Текстовые векторные модели (идентичны v5-text)
text_emb = model.encode("What is knowledge distillation?", prompt_name="query")
# Векторные модели для изображений
from PIL import Image
img = Image.open("photo.jpg")
img_emb = model.encode(img)
# Кросс-модальное сходство
similarity = model.similarity(text_emb, img_emb)tagОбучение
Основная идея заключается в композиции моделей с замороженным энкодером: берется мощная модель для создания векторных моделей текста, добавляются предварительно обученные визуальные и аудио-энкодеры, которые соединяются с помощью небольших обучаемых проекторов, после чего всё, кроме этих проекторов, замораживается. Обучаются только 0,35% от общего веса, что дает нам три свойства: (1) сохранение идентичности текста — основа не меняется, один и тот же ввод дает идентичный вывод; (2) эффективность обучения — обучение только проекторов происходит в 1,8–3,9 раза быстрее при использовании на 42–64% меньше видеопамяти; (3) модульность — компоненты могут загружаться независимо.

v5-omni наследует поддержку размерности Matryoshka от v5-text. Векторные модели изображений и аудио сохраняют большую часть качества при усечении, в то время как видео теряет качество сильнее при малых размерностях.

tagЗаключение
Принято считать, что для мультимодальных векторных моделей требуется обучение всей модели целиком. Мы с этим не согласны. v5-omni замораживает текстовую основу, обучает 0,35% весов и соответствует по качеству моделям, которые в 5–7 раз больше. Урок: композиция лучше, чем переобучение. Мощный текстовый энкодер — это самая сложная часть; как только он у вас есть, добавление зрения и аудио через легкие проекторы практически не требует усилий.
Это важно для продакшена. Ваши существующие индексы v5-text остаются нетронутыми. Тот же запрос, тот же вектор, побайтово. Вы просто получаете поиск по изображениям, аудио и видео, не переиндексируя ни единого документа. Это и есть настоящий прорыв: мультимодальный поиск как обновление, которое можно просто установить, а не как проект по миграции.
jina-embeddings-v5-omni-small — это лучшая по производительности открытая мультимодальная модель для создания векторных моделей с количеством параметров менее 2 млрд. jina-embeddings-v5-omni-nano достигает этого при 0,9 млрд параметров. Обе модели уже доступны на Hugging Face, Jina Search Foundation API, а также в качестве нативного эндпоинта логического вывода в Elasticsearch.






