Обзор
jina-vlm — мультиязычная vision-language модель на 2,4B параметров, достигающая state-of-the-art качества VQA среди открытых VLM 2B-масштаба. Она связывает vision-энкодер SigLIP2 с языковым декодером Qwen3 через attention-pooling коннектор, обеспечивающий токен-эффективную обработку изображений произвольного разрешения. Модель поддерживает 29 языков и 32K-токенный контекст, что делает её пригодной для понимания документов, анализа графиков, OCR и мультиязычного visual question answering.
Методы
Архитектура объединяет vision-энкодер SigLIP2 с языковым декодером Qwen3, соединёнными attention-pooling механизмом, обеспечивающим токен-эффективную обработку изображений произвольного разрешения. Ключевая инновация — attention-pooling коннектор, который применяет 2×2-пулинг для снижения 729 визуальных токенов на тайл до 182 (сокращение в 4× по токенам), давая 3,9× сокращение FLOPs префилла LLM и 4× сокращение памяти KV-cache при минимальном влиянии на бенчмарк-оценки. Изображения обрабатываются тайлингом: изображения произвольного разрешения делятся на до 12 тайлов плюс миниатюру, каждый обрабатывается независимо, затем комбинируется. Модель обучалась на разнообразном мультиязычном VQA-датасете, покрывающем 29 языков (арабский, китайский, английский, португальский, русский, турецкий и другие). leave-one-out ablation-исследование смеси данных диагностировало, какие категории данных (задача, домен, модальность, язык) необходимы, а какие избыточны, направляя эффективное распределение данных.
Производительность
Модель достигает наибольшего среднего балла (72,3) по восьми VQA-бенчмаркам среди VLM 2B-масштаба: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) и MME (1582). Она лидирует в мультиязычном мультимодальном понимании: MMMB (78,8) и Multilingual MMBench (74,3), покрывая арабский, китайский, английский, португальский, русский и турецкий. OCR-качество сильно — 778 на OCRBench (шкала 0–1000). Текстовое качество конкурентоспособно: MMLU (54,7), HellaSwag (75,6), хотя на MMLU-Pro оно снижено (30,3 против 46,4 базового) из-за интеграции vision-language. 4× сокращение токенов от attention-pooling даёт 3,9× сокращение FLOPs префилла LLM и 4× сокращение памяти KV-cache при минимальном влиянии на бенчмарки.
Руководство
Модель доступна на Hugging Face под CC-BY-NC-4.0 с весами и кодом инференса. Поддерживает изображения произвольного разрешения через автоматический тайлинг (до 12 тайлов плюс миниатюру). Используйте thinking-режим, включая do_sample=True и temperature > 0 для сложных задач рассуждения. Модель обрабатывает 32K-контекст для расширенных диалогов. Для мультиязычного VQA поддерживает 29 языков, включая английский, китайский, арабский, немецкий, испанский, французский, итальянский, японский, корейский, португальский, русский, турецкий, вьетнамский, тайский, индонезийский, хинди и бенгальский. Лучше всего подходит для понимания документов, анализа графиков/схем, OCR-задач и мультиязычного visual question answering. Ограничения: задачи подсчёта и тонкое пространственное рассуждение могут ухудшаться из-за тайлинга. Для оптимального инференса используйте bfloat16-точность на CUDA-GPU. Поддерживается MLX-инференс для Apple Silicon. Для embedding-поиска по визуальным документам сочетайте с jina-embeddings-v4 или jina-reranker-m0.




