I/O 圖 1
I/O 圖 2
選擇要比較的模型
論文 (2)
概述
jina-vlm 是一款 24 億參數的視覺語言模型,在開源的 20 億級視覺語言模型中,多語言視覺問答表現處於業界領先水平。它把 SigLIP2-So400M 視覺編碼器(4.49 億參數)與 Qwen3-1.7B 語言主幹網路相連,中間的注意力池化連接器可將視覺詞元數量壓縮至四分之一,同時保留空間資訊。藉助 12 個重疊圖塊加一張全域縮圖的切分方式,它能處理任意解析度、最高 4K 的圖像。訓練資料包含約 500 萬條多模態樣本和 120 億文本詞元,覆蓋 29 種語言,其中約一半為英語,其餘涵蓋中文、阿拉伯語、德語、西班牙語、法語、意大利語、日語、韓語等高資源和中等資源語言。
方法
訓練分兩個階段,編碼器、連接器、解碼器等所有組件都參與更新,不做凍結。第一階段(對齊訓練)側重跨語言的語義對齊,使用涵蓋自然場景、文件、資訊圖和示意圖的圖像描述資料集(PixmoCap、PangeaIns),並摻入 15% 的純文本資料,避免純文本任務能力退化。連接器的學習率高於編碼器和解碼器,預熱步數也更短。第二階段(指令微調)用多語言指令-回覆資料集(Aya、ShareGPT4V、LLaVA)讓模型適應對話式視覺問答。注意力池化連接器採用 2×2 池化,把每個圖塊的 729 個視覺詞元壓縮到 182 個,詞元量減少至四分之一而效能幾乎無損。圖塊尺寸為 378×378,重疊約 30%(112 像素,步長 266),可保留邊緣資訊。
效能
在八項 VQA 基準上取得 72.3 的平均分,在 20 億級視覺語言模型中最高,具體包括 MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778)和 MME(1582)。多語言多模態理解方面同樣領先,MMMB 達 78.8,Multilingual MMBench 達 74.3,覆蓋阿拉伯語、中文、英語、葡萄牙語、俄語和土耳其語。OCR 能力出色,在 0 至 1000 分制的 OCRBench 上得 778 分。純文本任務也頗具競爭力,MMLU 為 54.7,HellaSwag 為 75.6;受視覺語言融合影響,MMLU-Pro 如預期有所回落(30.3,基礎模型為 46.4)。注意力池化把詞元量壓縮至四分之一,使大模型預填充的 FLOPs 降至約 1/3.9、KV 快取記憶體降至四分之一,而基準成績幾乎不受影響。
最佳實踐
該模型已在 Hugging Face 上以 CC-BY-NC-4.0 協議釋出,含權重和推理程式碼。它透過自動切分圖塊(最多 12 塊加一張縮圖)支援任意解析度的影象。處理複雜推理任務時,可設定 do_sample=True 並讓 temperature 大於 0 以啟用思考模式。模型支援 32K 上下文長度,可應對長對話。多語言視覺問答方面,它支援 29 種語言,包括英語、中文、阿拉伯語、德語、西班牙語、法語、義大利語、日語、韓語、葡萄牙語、俄語、土耳其語、越南語、泰語、印尼語、印地語和孟加拉語。該模型最適合文件理解、圖表與示意圖分析、OCR 任務以及多語言視覺問答。受切分圖塊方式所限,它在計數任務和細粒度空間推理上存在不足。為獲得最佳推理效果,建議在支援 CUDA 的 GPU 上使用 bfloat16 精度。
提及此模型的部落格




