Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP terminal命令行articlellms.txtsmart_toy智能体data_objectSchemamenu_book文档



登录
login
Reader
copyright CC BY-NC 4.0
open_in_new 发布博客

jina-vlm

用于视觉问答的多语言视觉语言模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2025-12-04
输入
image
图像
abc
文本
arrow_forward
输出
abc
文本
模型详情
参数: 2.4B
输入词元长度: 32K
输入图像尺寸: 4096×4096
底座模型 help_outline
open_in_new
Qwen3-1.7B-Base
已训练语言 help_outline
39 种语言
支持的语言 help_outline
93 种语言
苹果芯片支持 help_outline
MLX
相关模型
link
jina-embeddings-v4
link
jina-reranker-m0
可通过以下方式获取
Jina API
Hugging Face
物理隔离
I/O 图 1

图像

jina-vlm

文本

文本

I/O 图 2

文本

jina-vlm

文本

选择要比较的模型
论文 (2)
arXiv
十二月 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
十二月 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

概述

jina-vlm 是一款 24 亿参数的视觉语言模型,在开源的 20 亿级视觉语言模型中,多语言视觉问答表现处于业界领先水平。它把 SigLIP2-So400M 视觉编码器(4.49 亿参数)与 Qwen3-1.7B 语言主干网络相连,中间的注意力池化连接器可将视觉词元数量压缩至四分之一,同时保留空间信息。借助 12 个重叠图块加一张全局缩略图的切分方式,它能处理任意分辨率、最高 4K 的图像。训练数据包含约 500 万条多模态样本和 120 亿文本词元,覆盖 29 种语言,其中约一半为英语,其余涵盖中文、阿拉伯语、德语、西班牙语、法语、意大利语、日语、韩语等高资源和中等资源语言。

方法

训练分两个阶段,编码器、连接器、解码器等所有组件都参与更新,不做冻结。第一阶段(对齐训练)侧重跨语言的语义对齐,使用涵盖自然场景、文档、信息图和示意图的图像描述数据集(PixmoCap、PangeaIns),并掺入 15% 的纯文本数据,避免纯文本任务能力退化。连接器的学习率高于编码器和解码器,预热步数也更短。第二阶段(指令微调)用多语言指令-回复数据集(Aya、ShareGPT4V、LLaVA)让模型适应对话式视觉问答。注意力池化连接器采用 2×2 池化,把每个图块的 729 个视觉词元压缩到 182 个,词元量减少至四分之一而性能几乎无损。图块尺寸为 378×378,重叠约 30%(112 像素,步长 266),可保留边缘信息。

性能

在八项 VQA 基准上取得 72.3 的平均分,在 20 亿级视觉语言模型中最高,具体包括 MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778)和 MME(1582)。多语言多模态理解方面同样领先,MMMB 达 78.8,Multilingual MMBench 达 74.3,覆盖阿拉伯语、中文、英语、葡萄牙语、俄语和土耳其语。OCR 能力出色,在 0 至 1000 分制的 OCRBench 上得 778 分。纯文本任务也颇具竞争力,MMLU 为 54.7,HellaSwag 为 75.6;受视觉语言融合影响,MMLU-Pro 如预期有所回落(30.3,基础模型为 46.4)。注意力池化把词元量压缩至四分之一,使大模型预填充的 FLOPs 降至约 1/3.9、KV 缓存显存降至四分之一,而基准成绩几乎不受影响。

最佳实践

该模型已在 Hugging Face 上以 CC-BY-NC-4.0 协议发布,含权重和推理代码。它通过自动切分图块(最多 12 块加一张缩略图)支持任意分辨率的图像。处理复杂推理任务时,可设置 do_sample=True 并让 temperature 大于 0 以启用思考模式。模型支持 32K 上下文长度,可应对长对话。多语言视觉问答方面,它支持 29 种语言,包括英语、中文、阿拉伯语、德语、西班牙语、法语、意大利语、日语、韩语、葡萄牙语、俄语、土耳其语、越南语、泰语、印尼语、印地语和孟加拉语。该模型最适合文档理解、图表与示意图分析、OCR 任务以及多语言视觉问答。受切分图块方式所限,它在计数任务和细粒度空间推理上存在不足。为获得最佳推理效果,建议在支持 CUDA 的 GPU 上使用 bfloat16 精度。
提及此模型的博客
十二月 04, 2025 • 7 分钟阅读
Jina-VLM:小型多语言视觉语言模型
全新 2B 视觉语言模型在多语言 VQA 上实现 SOTA,在纯文本任务上没有灾难性遗忘。
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。