概述
jina-vlm 是一个 2.4B 参数的多语言视觉语言模型,在开源 2B 级 VLM 中取得 SOTA 的 VQA 性能。它通过注意力池化连接器将 SigLIP2 视觉编码器与 Qwen3 语言解码器耦合,实现对任意分辨率图像的 token 高效处理。该模型支持 29 种语言和 32K token 上下文,适用于文档理解、图表分析、OCR 和多语言视觉问答。
方法
该架构将 SigLIP2 视觉编码器与 Qwen3 语言解码器结合,通过注意力池化机制连接,实现对任意分辨率图像的 token 高效处理。关键创新是注意力池化连接器,它应用 2×2 池化将每个 tile 的 729 个视觉 token 减少到 182(4× token 减少),带来 LLM prefill FLOPs 3.9× 减少和 KV-cache 内存 4× 减少,对基准分数影响极小。图像通过分块处理:任意分辨率图像被分割为最多 12 个 tile 加一个缩略图,每个独立处理后组合。该模型在一个覆盖 29 种语言(阿拉伯语、中文、英语、葡萄牙语、俄语、土耳其语等)的多样化多语言 VQA 数据集上训练。留一法数据混合消融研究诊断了哪些数据类别(任务、领域、模态、语言)是必要而非冗余的,指导了高效的数据分配。
性能
该模型在 2B 级 VLM 中于八项 VQA 基准上取得最高平均分(72.3):MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778/1000)和 MME(1582)。它在多语言多模态理解上领先:MMMB(78.8)和多语言 MMBench(74.3),涵盖阿拉伯语、中文、英语、葡萄牙语、俄语和土耳其语。OCR 性能强劲,OCRBench 上 778(0–1000 分制)。纯文本性能有竞争力:MMLU(54.7)、HellaSwag(75.6),但由于视觉语言集成,MMLU-Pro 上有所下降(30.3 对比基线 46.4)。注意力池化带来的 4× token 减少使 LLM prefill FLOPs 减少 3.9×,KV-cache 内存减少 4×,对基准影响极小。
最佳实践
该模型在 Hugging Face 上以 CC-BY-NC-4.0 授权提供,附带权重和推理代码。通过自动切片(最多 12 个切片加缩略图)支持任意分辨率图像。对于复杂推理任务,启用 do_sample=True 和 temperature > 0 使用思考模式。该模型处理 32K 上下文长度以支持扩展对话。多语言 VQA 支持 29 种语言,包括英语、中文、阿拉伯语、德语、西班牙语、法语、意大利语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、印尼语、印地语和孟加拉语。最适合文档理解、图表/示意图分析、OCR 任务和多语言视觉问答。局限性:计数任务和细粒度空间推理可能受切片方法影响。为了最佳推理,请在支持 CUDA 的 GPU 上使用 bfloat16 精度。Apple Silicon 支持 MLX 推理。针对视觉文档的基于向量的检索,请搭配 jina-embeddings-v4 或 jina-reranker-m0 使用。




