Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Извлечение данных
copyright CC BY-NC 4.0
open_in_new Пост о релизе

jina-vlm

Многоязычная модель зрительно-языкового восприятия для визуального ответа на вопросы
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2025-12-04
Вход
image
Изображение
abc
Текст
arrow_forward
Выход
abc
Текст
Подробности модели
Параметры: 2.4B
Длина входного токена: 32K
Размер входного изображения: 4096×4096
Базовая модель help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
Обученные языки help_outline
39 языки
Поддерживаемые языки help_outline
93 языки
Поддержка Apple Silicon help_outline
MLX
Похожие модели
link
jina-embeddings-v4
link
jina-reranker-m0
Доступно через
API Jina AI
Hugging Face
Air-gapped
График ввода-вывода 1

Изображение

jina-vlm

Текст

Текст

График ввода-вывода 2

Текст

jina-vlm

Текст

Парето-фронт help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlmПараметры (лог)accuracy
Эта модель
На фронте
Jina AI
Другие
AI2D
82.00
Параметры
2.5B
Ранг по баллу
13 / 47
Парето-фронт
Позади
Выберите модели для сравнения
Публикации (2)
arXiv
декабрь 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
декабрь 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

Обзор

jina-vlm — мультиязычная vision-language модель на 2,4B параметров, достигающая state-of-the-art качества VQA среди открытых VLM 2B-масштаба. Она связывает vision-энкодер SigLIP2 с языковым декодером Qwen3 через attention-pooling коннектор, обеспечивающий токен-эффективную обработку изображений произвольного разрешения. Модель поддерживает 29 языков и 32K-токенный контекст, что делает её пригодной для понимания документов, анализа графиков, OCR и мультиязычного visual question answering.

Методы

Архитектура объединяет vision-энкодер SigLIP2 с языковым декодером Qwen3, соединёнными attention-pooling механизмом, обеспечивающим токен-эффективную обработку изображений произвольного разрешения. Ключевая инновация — attention-pooling коннектор, который применяет 2×2-пулинг для снижения 729 визуальных токенов на тайл до 182 (сокращение в 4× по токенам), давая 3,9× сокращение FLOPs префилла LLM и 4× сокращение памяти KV-cache при минимальном влиянии на бенчмарк-оценки. Изображения обрабатываются тайлингом: изображения произвольного разрешения делятся на до 12 тайлов плюс миниатюру, каждый обрабатывается независимо, затем комбинируется. Модель обучалась на разнообразном мультиязычном VQA-датасете, покрывающем 29 языков (арабский, китайский, английский, португальский, русский, турецкий и другие). leave-one-out ablation-исследование смеси данных диагностировало, какие категории данных (задача, домен, модальность, язык) необходимы, а какие избыточны, направляя эффективное распределение данных.

Производительность

Модель достигает наибольшего среднего балла (72,3) по восьми VQA-бенчмаркам среди VLM 2B-масштаба: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) и MME (1582). Она лидирует в мультиязычном мультимодальном понимании: MMMB (78,8) и Multilingual MMBench (74,3), покрывая арабский, китайский, английский, португальский, русский и турецкий. OCR-качество сильно — 778 на OCRBench (шкала 0–1000). Текстовое качество конкурентоспособно: MMLU (54,7), HellaSwag (75,6), хотя на MMLU-Pro оно снижено (30,3 против 46,4 базового) из-за интеграции vision-language. 4× сокращение токенов от attention-pooling даёт 3,9× сокращение FLOPs префилла LLM и 4× сокращение памяти KV-cache при минимальном влиянии на бенчмарки.

Руководство

Модель доступна на Hugging Face под CC-BY-NC-4.0 с весами и кодом инференса. Поддерживает изображения произвольного разрешения через автоматический тайлинг (до 12 тайлов плюс миниатюру). Используйте thinking-режим, включая do_sample=True и temperature > 0 для сложных задач рассуждения. Модель обрабатывает 32K-контекст для расширенных диалогов. Для мультиязычного VQA поддерживает 29 языков, включая английский, китайский, арабский, немецкий, испанский, французский, итальянский, японский, корейский, португальский, русский, турецкий, вьетнамский, тайский, индонезийский, хинди и бенгальский. Лучше всего подходит для понимания документов, анализа графиков/схем, OCR-задач и мультиязычного visual question answering. Ограничения: задачи подсчёта и тонкое пространственное рассуждение могут ухудшаться из-за тайлинга. Для оптимального инференса используйте bfloat16-точность на CUDA-GPU. Поддерживается MLX-инференс для Apple Silicon. Для embedding-поиска по визуальным документам сочетайте с jina-embeddings-v4 или jina-reranker-m0.

Блоги, в которых упоминается эта модель
декабрь 04, 2025 • 7 минуты чтения
Jina-VLM: Маленькая многоязычная модель Vision Language Model
Новая модель vision language на 2B достигла SOTA в многоязычном VQA, без катастрофического забывания в задачах, связанных только с текстом.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.