Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
資料錄入
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-vlm

用於視覺問答的多語言視覺語言模型
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2025-12-04
輸入
image
圖片
abc
文字
arrow_forward
輸出
abc
文字
模型詳情
參數: 2.4B
輸入詞元長度: 32K
輸入影像尺寸: 4096×4096
底座模型 help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
已訓練語言 help_outline
39 種語言
支援的語言 help_outline
93 種語言
Apple 晶片支援 help_outline
MLX
相關模型
link
jina-embeddings-v4
link
jina-reranker-m0
可透過以下方式獲取
Jina API
Hugging Face
物理隔離
I/O 圖 1

圖片

jina-vlm

文字

文字

I/O 圖 2

文字

jina-vlm

文字

帕累託前緣 help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlm參數量(對數)accuracy
本模型
在前緣上
Jina AI
其他
AI2D
82.00
參數量
2.5B
按分數的排名
13 / 47
帕累託前緣
在前緣之後
選擇要比較的模型
論文 (2)
arXiv
十二月 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
十二月 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

概述

jina-vlm 是一個 2.4B 參數的多語言視覺語言模型,在開源 2B 級 VLM 中取得 SOTA 的 VQA 效能。它透過注意力池化連接器將 SigLIP2 視覺編碼器與 Qwen3 語言解碼器耦合,實現對任意解析度影像的 token 高效處理。該模型支援 29 種語言和 32K token 上下文,適用於文件理解、圖表分析、OCR 和多語言視覺問答。

方法

該架構將 SigLIP2 視覺編碼器與 Qwen3 語言解碼器結合,透過注意力池化機制連接,實現對任意解析度影像的 token 高效處理。關鍵創新是注意力池化連接器,它應用 2×2 池化將每個 tile 的 729 個視覺 token 減少到 182(4× token 減少),帶來 LLM prefill FLOPs 3.9× 減少和 KV-cache 記憶體 4× 減少,對基準分數影響極小。影像透過分塊處理:任意解析度影像被分割為最多 12 個 tile 加一個縮圖,每個獨立處理後組合。該模型在一個覆蓋 29 種語言(阿拉伯文、中文、英文、葡萄牙文、俄文、土耳其文等)的多樣化多語言 VQA 資料集上訓練。留一法資料混合消融研究診斷了哪些資料類別(任務、領域、模態、語言)是必要而非冗餘的,指導了高效的資料分配。

效能

該模型在 2B 級 VLM 中於八項 VQA 基準上取得最高平均分(72.3):MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778/1000)和 MME(1582)。它在多語言多模態理解上領先:MMMB(78.8)和多語言 MMBench(74.3),涵蓋阿拉伯文、中文、英文、葡萄牙文、俄文和土耳其文。OCR 性能強勁,OCRBench 上 778(0–1000 分制)。純文字性能有競爭力:MMLU(54.7)、HellaSwag(75.6),但由於視覺語言整合,MMLU-Pro 上有所降低(30.3 對比基準 46.4)。注意力池化帶來的 4× token 減少使 LLM prefill FLOPs 減少 3.9×,KV-cache 記憶體減少 4×,對基準影響極小。

最佳實踐

該模型在 Hugging Face 上以 CC-BY-NC-4.0 授權提供,附帶權重和推理程式碼。透過自動切片(最多 12 個切片加縮圖)支援任意解析度影像。對於複雜推理任務,啟用 do_sample=True 和 temperature > 0 使用思考模式。該模型處理 32K 上下文長度以支援延伸對話。多語言 VQA 支援 29 種語言,包括英文、中文、阿拉伯文、德文、西班牙文、法文、義大利文、日文、韓文、葡萄牙文、俄文、土耳其文、越南文、泰文、印尼文、印地文和孟加拉文。最適合文件理解、圖表/示意圖分析、OCR 任務和多語言視覺問答。限制:計數任務和細粒度空間推理可能受切片方法影響。為了最佳推論,請在支援 CUDA 的 GPU 上使用 bfloat16 精度。Apple Silicon 支援 MLX 推論。針對視覺文件的基於向量的檢索,請搭配 jina-embeddings-v4 或 jina-reranker-m0 使用。

提及此模型的部落格
十二月 04, 2025 • 7 分鐘閱讀
Jina-VLM:小型多語言視覺語言模型
全新 2B 視覺語言模型在多語言 VQA 上實現 SOTA,在純文字任務上沒有災難性遺忘。
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。