График ввода-вывода 1

Текст

jina-embeddings-v4

Задача

Вектор

График ввода-вывода 2

Изображение

jina-embeddings-v4

Задача

Вектор

График ввода-вывода 3

несколько

Вектор

Текст

jina-embeddings-v4

Задача

График ввода-вывода 4

несколько

Вектор

Изображение

jina-embeddings-v4

Задача

Парето-фронт
30M100M300M1B3.0B10B40506070bge-base-en-v1.5bge-m3bge-small-en-v1.5CodeRankEmbedCodeSage-baseCodeSage-largeCodeSage-large-v2CodeSage-smallCodeXEmbed-7BContrievere5-base-v2e5-mistral-7b-instructe5-small-v2granite-embedding-engli…granite-embedding-small…gte-base-en-v1.5gte-modernbert-basegte-Qwen2-1.5B-instructjina-code-embeddings-0.…jina-embeddings-v3modernbert-embed-baseNV-Embed-v2SFR-Embedding-2_RSFR-Embedding-Code-2B_RSFR-Embedding-Code-400M…snowflake-arctic-embed-…UniXcoderjina-embeddings-v4Параметры (лог)nDCG@10
Эта модель
На фронте
Jina AI
Другие
CoIR
71.59
Параметры
3.8B
Ранг по баллу
2 / 31
Парето-фронт
Позади
Распределение значений
AUC 0.8308
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Задача
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8360.400.500.600.700.800.90
Связанные6.7%
Сложный отрицательный1.1%
Несвязанные0.8%
Рекомендуемые пороги
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
сбалансированный · 0.618
AUC
0.8308
Потолок шума
0.877
Обрыв полноты
0.516
Измерено пар
119 / 11k
Компоненты вектора
-0.19-0.020.15
σ 0.0221 · 487k значений
Геометрия эмбеддингов
02048
Среднее по измерениям, наведите для диапазона
Уровень шума
0.496
Эффективных изм.
73 / 2048
Усечение размерности
12825651210242048
text-matching · Порог в зависимости от запрошенной размерности
Языковые пары
de-ruen-deen-koen-zhja-ko
Разброс порога между парами: 0.069
Выберите модели для сравнения
Публикации (2)

Обзор

jina-embeddings-v4 — мультимодальная embedding-модель на 3,8B параметров, объединяющая представления текста и изображений в одной архитектуре. Она уникально поддерживает как режим одно-векторного (dense), так и режим мульти-векторного (late-interaction/в стиле ColBERT) вывода, позволяя командам балансировать эффективность индексации и точность поиска без смены модели. Модель достигает state-of-the-art качества на retrieval визуально насыщенных документов, нативно обрабатывая таблицы, диаграммы, схемы и мультимедийные форматы.

Методы

Архитектура объединяет крупный трансформерный энкодер-бэкбон с vision-энкодером на базе Qwen2.5-VL, обрабатывая текст (до 32K токенов) и изображения (768×28×28 патчи) через общие слои внимания. Три task-специфичных LoRA-адаптера (по 60M параметров каждый) специализируют модель на: асимметричном query-document поиске, семантической текстовой схожести и поиске кода. Двойной дизайн вывода — ключевая инновация: модель может формировать единый 2048-мерный dense-вектор (для быстрого ANN-индексирования с обрезкой Matryoshka до 128 измерений) или набор 128-мерных токен-векторов для late-interaction scoring. Обучение использовало двухстадийную программу: совместный контрастный pretraining на парах текст-изображение и текст-текст, затем обучение task-специфичных LoRA-адаптеров. Поддерживается late chunking для документов, превышающих 32K-токенное контекстное окно. Действует Qwen Research License.

Производительность

На JinaVDR (Visual Document Retrieval) модель набирает в среднем 72,19, против 64,50 у ColPali-v1.2. На ViDoRe она достигает в среднем 84,11 (90,17 в режиме мульти-вектора), против 83,90 у ColPali. Cross-modal retrieval достигает 84,11 на бенчмарке CLIP, превосходя jina-clip-v2 (81,12) и nllb-clip-large-siglip (83,19). Показатели text retrieval: 55,97 на MTEB-en, 66,49 на MMTEB, 67,11 на LongEmbed (против 55,66 у jina-embeddings-v3). Семантическая схожесть достигает 85,89 на English STS и 72,70 на мультиязычном STS. Поиск кода набирает 71,59 на CoIR. Cross-modal alignment достигает 0,71 косинусной схожести (против 0,15 у OpenAI CLIP). Режим мульти-вектора последовательно превосходит режим одно-вектора на визуально насыщенных задачах; режим одно-вектора обеспечивает эффективные результаты для стандартного text retrieval.

Руководство

Выбирайте режим вывода в зависимости от конвейера: одновекторный режим для масштабного ANN-индексирования (доступна обрезка Matryoshka до 128–512 измерений), мультивекторный режим для пере-ранжирования top-k кандидатов на визуально насыщенных документах. Выбирайте LoRA-адаптер через параметр task API: 'retrieval' для query-document поиска, 'text-matching' для семантической схожести, 'code' для поиска кода. Для документов, превышающих 32K токенов, используйте `late_chunking. Оверхед 60M параметров на LoRA-адаптер незначителен (<2 % увеличения памяти), и все три адаптера можно загрузить одновременно. Модель лицензирована под Qwen Research License (коммерческое использование без коммерческой лицензии не допускается). Для продакшн-развёртываний используйте CUDA-GPU; модель доступна через Jina API, AWS, Azure и маркетплейсы GCP. Для чисто текстовых задач jina-embeddings-v5-text-small` предлагает лучшую точность на параметр за долю вычислительных затрат.

Блоги, в которых упоминается эта модель
март 11, 2026 • 7 минуты чтения
Бутстрэппинг аудиоэмбеддингов на базе мультимодальных LLM
Превратите любую мультимодальную LLM в малую векторную модель аудио, которая превосходит CLAP, используя в 25 раз меньше данных.
февраль 19, 2026 • 7 минуты чтения
jina-embeddings-v5-text: новые SOTA компактные мультиязычные векторные модели
Две многоязычные модели Embeddings объемом менее 1 млрд параметров с лучшей в своем классе производительностью, доступные в Elastic Inference Service, Llama.cpp и MLX.
сентябрь 09, 2025 • 11 минуты чтения
Мультимодальные 向量模型 в Llama.cpp и GGUF
Мы добавили мультимодальные向量模型 в llama.cpp и GGUF и попутно обнаружили несколько неожиданных проблем.
сентябрь 04, 2025 • 6 минуты чтения
Jina Code Embeddings: SOTA для извлечения кода при 0.5B и 1.5B
Генеративные LLM для кода → векторные модели кода: модели размером 0.5B/1.5B достигают SOTA производительности в 25 бенчмарках извлечения кода.
август 13, 2025 • 15 минуты чтения
Оптимизация GGUF для моделей формирования векторных представлений только с декодером
4000词元/сек для модели 向量模型 с 3 миллиардами параметров на графическом процессоре L4 — это, вероятно, предел скорости, которого вы достигнете с llama.cpp. Или нет?