Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
データ取り込み
copyright CC BY-NC 4.0
open_in_new リリース記事

jina-vlm

視覚的な質問応答のための多言語視覚言語モデル
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2025-12-04
入力
image
画像
abc
テキスト
arrow_forward
出力
abc
テキスト
モデル詳細
パラメータ: 2.4B
入力トークン長: 32K
入力画像サイズ: 4096×4096
ベースモデル help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
訓練された言語 help_outline
39 言語
サポートされている言語 help_outline
93 言語
Apple Silicon サポート help_outline
MLX
関連機種
link
jina-embeddings-v4
link
jina-reranker-m0
以下の方法で入手できます
Jina API
Hugging Face
エアギャップ
I/O 図 1

画像

jina-vlm

テキスト

テキスト

I/O 図 2

テキスト

jina-vlm

テキスト

パレートフロン help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlmパラメータ数(対数)accuracy
このモデル
フロン上
Jina AI
その他
AI2D
82.00
パラメータ
2.5B
スコア順位
13 / 47
パレートフロン
フロン未満
比較するモデルを選択してください
論文 (2)
arXiv
12月 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
12月 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

概要

jina-vlm は 2.4B パラメータの多言語ビジョン言語モデルで、オープンな 2B スケールの VLM において SOTA の VQA 性能を達成します。SigLIP2 ビジョンエンコーダーをアテンションプーリングコネクタを介して Qwen3 言語デコーダと結合し、任意解像度画像のトークン効率の良い処理を可能にします。モデルは 29 言語と 32K トークンコンテキストをサポートし、文書理解、チャート分析、OCR、多言語視覚質問応答に適しています。

方法

アーキテクチャは SigLIP2 ビジョンエンコーダーと Qwen3 言語デコーダを組み合わせ、任意解像度画像のトークン効率の良い処理を可能にするアテンションプーリング機構で接続しています。中核の革新はアテンションプーリングコネクタで、2×2 プーリングを適用してタイルあたりの 729 のビジュアルトークンを 182 に削減します(4× のトークン削減)。LLM プリフィル FLOPs が 3.9× 削減され、KV キャッシュメモリは 4× 削減され、ベンチマークスコアへの影響は最小です。画像はタイル分割で処理されます:任意解像度画像は最大 12 タイルとサムネイルに分割され、それぞれ独立して処理された後、結合されます。モデルはアラビア語、中国語、英語、ポルトガル語、ロシア語、トルコ語など 29 言語をカバーする多彩な多言語 VQA データセットで訓練されました。leave-one-out データ混合アブレーション研究により、どのデータカテゴリ(タスク、ドメイン、モダリティ、言語)が必要であり冗長でないかが診断され、効率的なデータ配分を導きました。

パフォーマンス

モデルは 2B スケールの VLM において 8 つの VQA ベンチマーク全体で最高の平均スコア(72.3)を達成します:MathVista(59.4)、AI2D(80.8)、ChartQA(79.5)、DocVQA(90.6)、InfoVQA(65.9)、RealWorldQA(64.9)、OCRBench(778/1000)、MME(1582)。多言語マルチモーダル理解でリードしています:MMMB(78.8)と Multilingual MMBench(74.3)、アラビア語、中国語、英語、ポルトガル語、ロシア語、トルコ語をカバー。OCR 性能は OCRBench で 778(0–1000 スケール)と強力です。テキストのみの性能は競争力があります:MMLU(54.7)、HellaSwag(75.6)、ただしビジョン言語統合により MMLU-Pro では低下しています(ベース 46.4 に対し 30.3)。アテンションプーリングによる 4× のトークン削減は、LLM プリフィル FLOPs の 3.9× 削減と KV キャッシュメモリの 4× 削減をもたらし、ベンチマークへの影響は最小です。

ベストプラクティス

モデルは Hugging Face で CC-BY-NC-4.0 配下、重みと推論コード付きで利用可能です。自動タイル分割(最大 12 タイルとサムネイル)により任意解像度画像をサポートします。複雑な推論タスクには do_sample=True と temperature > 0 を有効にしてシンキングモードを使用してください。モデルは拡張対話のために 32K コンテキスト長を処理します。多言語 VQA では、英語、中国語、アラビア語、ドイツ語、スペイン語、フランス語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、トルコ語、ベトナム語、タイ語、インドネシア語、ヒンディー語、ベンガル語を含む 29 言語をサポートします。文書理解、チャート/図の分析、OCR タスク、多言語視覚質問応答に最適です。制限事項:カウントタスクと細かい空間推論はタイル分割アプローチの影響を受ける可能性があります。最適な推論には、CUDA 対応 GPU 上で bfloat16 精度を使用してください。Apple Silicon では MLX 推論がサポートされています。視覚文書への embedding ベース検索には、jina-embeddings-v4 または jina-reranker-m0 とペアにしてください。

このモデルについて言及しているブログ
12月 04, 2025 • 7 読む時間
Jina-VLM: 小規模多言語Vision Language Model
新しい2BのVision Language Modelが、多言語VQAでSOTAを達成し、テキストのみのタスクでは壊滅的な忘却が発生しません。
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。