I/O 图 1
I/O 图 2
选择要比较的模型
论文 (2)
概述
jina-vlm 是一款 24 亿参数的视觉语言模型,在开源的 20 亿级视觉语言模型中,多语言视觉问答表现处于业界领先水平。它把 SigLIP2-So400M 视觉编码器(4.49 亿参数)与 Qwen3-1.7B 语言主干网络相连,中间的注意力池化连接器可将视觉词元数量压缩至四分之一,同时保留空间信息。借助 12 个重叠图块加一张全局缩略图的切分方式,它能处理任意分辨率、最高 4K 的图像。训练数据包含约 500 万条多模态样本和 120 亿文本词元,覆盖 29 种语言,其中约一半为英语,其余涵盖中文、阿拉伯语、德语、西班牙语、法语、意大利语、日语、韩语等高资源和中等资源语言。
方法
训练分两个阶段,编码器、连接器、解码器等所有组件都参与更新,不做冻结。第一阶段(对齐训练)侧重跨语言的语义对齐,使用涵盖自然场景、文档、信息图和示意图的图像描述数据集(PixmoCap、PangeaIns),并掺入 15% 的纯文本数据,避免纯文本任务能力退化。连接器的学习率高于编码器和解码器,预热步数也更短。第二阶段(指令微调)用多语言指令-回复数据集(Aya、ShareGPT4V、LLaVA)让模型适应对话式视觉问答。注意力池化连接器采用 2×2 池化,把每个图块的 729 个视觉词元压缩到 182 个,词元量减少至四分之一而性能几乎无损。图块尺寸为 378×378,重叠约 30%(112 像素,步长 266),可保留边缘信息。
性能
在八项 VQA 基准上取得 72.3 的平均分,在 20 亿级视觉语言模型中最高,具体包括 MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778)和 MME(1582)。多语言多模态理解方面同样领先,MMMB 达 78.8,Multilingual MMBench 达 74.3,覆盖阿拉伯语、中文、英语、葡萄牙语、俄语和土耳其语。OCR 能力出色,在 0 至 1000 分制的 OCRBench 上得 778 分。纯文本任务也颇具竞争力,MMLU 为 54.7,HellaSwag 为 75.6;受视觉语言融合影响,MMLU-Pro 如预期有所回落(30.3,基础模型为 46.4)。注意力池化把词元量压缩至四分之一,使大模型预填充的 FLOPs 降至约 1/3.9、KV 缓存显存降至四分之一,而基准成绩几乎不受影响。
最佳实践
该模型已在 Hugging Face 上以 CC-BY-NC-4.0 协议发布,含权重和推理代码。它通过自动切分图块(最多 12 块加一张缩略图)支持任意分辨率的图像。处理复杂推理任务时,可设置 do_sample=True 并让 temperature 大于 0 以启用思考模式。模型支持 32K 上下文长度,可应对长对话。多语言视觉问答方面,它支持 29 种语言,包括英语、中文、阿拉伯语、德语、西班牙语、法语、意大利语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、印尼语、印地语和孟加拉语。该模型最适合文档理解、图表与示意图分析、OCR 任务以及多语言视觉问答。受切分图块方式所限,它在计数任务和细粒度空间推理上存在不足。为获得最佳推理效果,建议在支持 CUDA 的 GPU 上使用 bfloat16 精度。
提及此模型的博客




