概述
jina-vlm 是一個 2.4B 參數的多語言視覺語言模型,在開源 2B 級 VLM 中取得 SOTA 的 VQA 效能。它透過注意力池化連接器將 SigLIP2 視覺編碼器與 Qwen3 語言解碼器耦合,實現對任意解析度影像的 token 高效處理。該模型支援 29 種語言和 32K token 上下文,適用於文件理解、圖表分析、OCR 和多語言視覺問答。
方法
該架構將 SigLIP2 視覺編碼器與 Qwen3 語言解碼器結合,透過注意力池化機制連接,實現對任意解析度影像的 token 高效處理。關鍵創新是注意力池化連接器,它應用 2×2 池化將每個 tile 的 729 個視覺 token 減少到 182(4× token 減少),帶來 LLM prefill FLOPs 3.9× 減少和 KV-cache 記憶體 4× 減少,對基準分數影響極小。影像透過分塊處理:任意解析度影像被分割為最多 12 個 tile 加一個縮圖,每個獨立處理後組合。該模型在一個覆蓋 29 種語言(阿拉伯文、中文、英文、葡萄牙文、俄文、土耳其文等)的多樣化多語言 VQA 資料集上訓練。留一法資料混合消融研究診斷了哪些資料類別(任務、領域、模態、語言)是必要而非冗餘的,指導了高效的資料分配。
效能
該模型在 2B 級 VLM 中於八項 VQA 基準上取得最高平均分(72.3):MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778/1000)和 MME(1582)。它在多語言多模態理解上領先:MMMB(78.8)和多語言 MMBench(74.3),涵蓋阿拉伯文、中文、英文、葡萄牙文、俄文和土耳其文。OCR 性能強勁,OCRBench 上 778(0–1000 分制)。純文字性能有競爭力:MMLU(54.7)、HellaSwag(75.6),但由於視覺語言整合,MMLU-Pro 上有所降低(30.3 對比基準 46.4)。注意力池化帶來的 4× token 減少使 LLM prefill FLOPs 減少 3.9×,KV-cache 記憶體減少 4×,對基準影響極小。
最佳實踐
該模型在 Hugging Face 上以 CC-BY-NC-4.0 授權提供,附帶權重和推理程式碼。透過自動切片(最多 12 個切片加縮圖)支援任意解析度影像。對於複雜推理任務,啟用 do_sample=True 和 temperature > 0 使用思考模式。該模型處理 32K 上下文長度以支援延伸對話。多語言 VQA 支援 29 種語言,包括英文、中文、阿拉伯文、德文、西班牙文、法文、義大利文、日文、韓文、葡萄牙文、俄文、土耳其文、越南文、泰文、印尼文、印地文和孟加拉文。最適合文件理解、圖表/示意圖分析、OCR 任務和多語言視覺問答。限制:計數任務和細粒度空間推理可能受切片方法影響。為了最佳推論,請在支援 CUDA 的 GPU 上使用 bfloat16 精度。Apple Silicon 支援 MLX 推論。針對視覺文件的基於向量的檢索,請搭配 jina-embeddings-v4 或 jina-reranker-m0 使用。




