Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
数据录入
copyright CC BY-NC 4.0
open_in_new 发布博客

jina-vlm

用于视觉问答的多语言视觉语言模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2025-12-04
输入
image
图片
abc
文本
arrow_forward
输出
abc
文本
模型详情
参数: 2.4B
输入词元长度: 32K
输入图像尺寸: 4096×4096
底座模型 help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
已训练语言 help_outline
39 种语言
支持的语言 help_outline
93 种语言
苹果芯片支持 help_outline
MLX
相关模型
link
jina-embeddings-v4
link
jina-reranker-m0
可通过以下方式获取
Jina API
Hugging Face
物理隔离
I/O 图 1

图片

jina-vlm

文本

文本

I/O 图 2

文本

jina-vlm

文本

帕累托前沿 help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlm参数量(对数)accuracy
本模型
在前沿上
Jina AI
其他
AI2D
82.00
参数量
2.5B
按分数的排名
13 / 47
帕累托前沿
在前沿之后
选择要比较的模型
论文 (2)
arXiv
十二月 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
十二月 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

概述

jina-vlm 是一个 2.4B 参数的多语言视觉语言模型,在开源 2B 级 VLM 中取得 SOTA 的 VQA 性能。它通过注意力池化连接器将 SigLIP2 视觉编码器与 Qwen3 语言解码器耦合,实现对任意分辨率图像的 token 高效处理。该模型支持 29 种语言和 32K token 上下文,适用于文档理解、图表分析、OCR 和多语言视觉问答。

方法

该架构将 SigLIP2 视觉编码器与 Qwen3 语言解码器结合,通过注意力池化机制连接,实现对任意分辨率图像的 token 高效处理。关键创新是注意力池化连接器,它应用 2×2 池化将每个 tile 的 729 个视觉 token 减少到 182(4× token 减少),带来 LLM prefill FLOPs 3.9× 减少和 KV-cache 内存 4× 减少,对基准分数影响极小。图像通过分块处理:任意分辨率图像被分割为最多 12 个 tile 加一个缩略图,每个独立处理后组合。该模型在一个覆盖 29 种语言(阿拉伯语、中文、英语、葡萄牙语、俄语、土耳其语等)的多样化多语言 VQA 数据集上训练。留一法数据混合消融研究诊断了哪些数据类别(任务、领域、模态、语言)是必要而非冗余的,指导了高效的数据分配。

性能

该模型在 2B 级 VLM 中于八项 VQA 基准上取得最高平均分(72.3):MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778/1000)和 MME(1582)。它在多语言多模态理解上领先:MMMB(78.8)和多语言 MMBench(74.3),涵盖阿拉伯语、中文、英语、葡萄牙语、俄语和土耳其语。OCR 性能强劲,OCRBench 上 778(0–1000 分制)。纯文本性能有竞争力:MMLU(54.7)、HellaSwag(75.6),但由于视觉语言集成,MMLU-Pro 上有所下降(30.3 对比基线 46.4)。注意力池化带来的 4× token 减少使 LLM prefill FLOPs 减少 3.9×,KV-cache 内存减少 4×,对基准影响极小。

最佳实践

该模型在 Hugging Face 上以 CC-BY-NC-4.0 授权提供,附带权重和推理代码。通过自动切片(最多 12 个切片加缩略图)支持任意分辨率图像。对于复杂推理任务,启用 do_sample=True 和 temperature > 0 使用思考模式。该模型处理 32K 上下文长度以支持扩展对话。多语言 VQA 支持 29 种语言,包括英语、中文、阿拉伯语、德语、西班牙语、法语、意大利语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、印尼语、印地语和孟加拉语。最适合文档理解、图表/示意图分析、OCR 任务和多语言视觉问答。局限性:计数任务和细粒度空间推理可能受切片方法影响。为了最佳推理,请在支持 CUDA 的 GPU 上使用 bfloat16 精度。Apple Silicon 支持 MLX 推理。针对视觉文档的基于向量的检索,请搭配 jina-embeddings-v4 或 jina-reranker-m0 使用。

提及此模型的博客
十二月 04, 2025 • 7 分钟阅读
Jina-VLM:小型多语言视觉语言模型
全新 2B 视觉语言模型在多语言 VQA 上实现 SOTA,在纯文本任务上没有灾难性遗忘。
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 标志
open_in_new
下载 Elastic 标志
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业使用,不面向消费者。