Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP terminal命令列articlellms.txtsmart_toy智慧體data_objectSchemamenu_book文件



登入
login
Reader
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-vlm

用於視覺問答的多語言視覺語言模型
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2025-12-04
輸入
image
影象
abc
文字
arrow_forward
輸出
abc
文字
模型詳情
引數: 2.4B
輸入詞元長度: 32K
輸入影象尺寸: 4096×4096
底座模型 help_outline
open_in_new
Qwen3-1.7B-Base
已訓練語言 help_outline
39 種語言
支援的語言 help_outline
93 種語言
Apple 晶片支援 help_outline
MLX
相關模型
link
jina-embeddings-v4
link
jina-reranker-m0
可透過以下方式獲取
Jina API
Hugging Face
物理隔離
I/O 圖 1

影象

jina-vlm

文字

文字

I/O 圖 2

文字

jina-vlm

文字

選擇要比較的模型
論文 (2)
arXiv
十二月 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
十二月 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

概述

jina-vlm 是一款 24 億參數的視覺語言模型,在開源的 20 億級視覺語言模型中,多語言視覺問答表現處於業界領先水平。它把 SigLIP2-So400M 視覺編碼器(4.49 億參數)與 Qwen3-1.7B 語言主幹網路相連,中間的注意力池化連接器可將視覺詞元數量壓縮至四分之一,同時保留空間資訊。藉助 12 個重疊圖塊加一張全域縮圖的切分方式,它能處理任意解析度、最高 4K 的圖像。訓練資料包含約 500 萬條多模態樣本和 120 億文本詞元,覆蓋 29 種語言,其中約一半為英語,其餘涵蓋中文、阿拉伯語、德語、西班牙語、法語、意大利語、日語、韓語等高資源和中等資源語言。

方法

訓練分兩個階段,編碼器、連接器、解碼器等所有組件都參與更新,不做凍結。第一階段(對齊訓練)側重跨語言的語義對齊,使用涵蓋自然場景、文件、資訊圖和示意圖的圖像描述資料集(PixmoCap、PangeaIns),並摻入 15% 的純文本資料,避免純文本任務能力退化。連接器的學習率高於編碼器和解碼器,預熱步數也更短。第二階段(指令微調)用多語言指令-回覆資料集(Aya、ShareGPT4V、LLaVA)讓模型適應對話式視覺問答。注意力池化連接器採用 2×2 池化,把每個圖塊的 729 個視覺詞元壓縮到 182 個,詞元量減少至四分之一而效能幾乎無損。圖塊尺寸為 378×378,重疊約 30%(112 像素,步長 266),可保留邊緣資訊。

效能

在八項 VQA 基準上取得 72.3 的平均分,在 20 億級視覺語言模型中最高,具體包括 MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778)和 MME(1582)。多語言多模態理解方面同樣領先,MMMB 達 78.8,Multilingual MMBench 達 74.3,覆蓋阿拉伯語、中文、英語、葡萄牙語、俄語和土耳其語。OCR 能力出色,在 0 至 1000 分制的 OCRBench 上得 778 分。純文本任務也頗具競爭力,MMLU 為 54.7,HellaSwag 為 75.6;受視覺語言融合影響,MMLU-Pro 如預期有所回落(30.3,基礎模型為 46.4)。注意力池化把詞元量壓縮至四分之一,使大模型預填充的 FLOPs 降至約 1/3.9、KV 快取記憶體降至四分之一,而基準成績幾乎不受影響。

最佳實踐

該模型已在 Hugging Face 上以 CC-BY-NC-4.0 協議釋出,含權重和推理程式碼。它透過自動切分圖塊(最多 12 塊加一張縮圖)支援任意解析度的影象。處理複雜推理任務時,可設定 do_sample=True 並讓 temperature 大於 0 以啟用思考模式。模型支援 32K 上下文長度,可應對長對話。多語言視覺問答方面,它支援 29 種語言,包括英語、中文、阿拉伯語、德語、西班牙語、法語、義大利語、日語、韓語、葡萄牙語、俄語、土耳其語、越南語、泰語、印尼語、印地語和孟加拉語。該模型最適合文件理解、圖表與示意圖分析、OCR 任務以及多語言視覺問答。受切分圖塊方式所限,它在計數任務和細粒度空間推理上存在不足。為獲得最佳推理效果,建議在支援 CUDA 的 GPU 上使用 bfloat16 精度。
提及此模型的部落格
十二月 04, 2025 • 7 分鐘閱讀
Jina-VLM:小型多語言視覺語言模型
全新 2B 視覺語言模型在多語言 VQA 上實現 SOTA,在純文字任務上沒有災難性遺忘。
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。