Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Acquisizione dati
copyright CC BY-NC 4.0
open_in_new Post di rilascio

jina-vlm

Modello di visione multilingue per la risposta visiva alle domande
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2025-12-04
Ingresso
image
Immagine
abc
Testo
arrow_forward
Produzione
abc
Testo
Dettagli del modello
Parametri: 2.4B
Lunghezza del token di input: 32K
Dimensione immagine di input: 4096×4096
Modello base help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
Lingue addestrate help_outline
39 lingue
Lingue supportate help_outline
93 lingue
Supporto Apple Silicon help_outline
MLX
Modelli correlati
link
jina-embeddings-v4
link
jina-reranker-m0
Disponibile tramite
API di Jina
Hugging Face
Air-gapped
Grafico I/O 1

Immagine

jina-vlm

Testo

Testo

Grafico I/O 2

Testo

jina-vlm

Testo

Frontiera di Pareto help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlmParametri (log)accuracy
Questo modello
Sulla frontiera
Jina AI
Altri
AI2D
82.00
Parametri
2.5B
Classifica per punteggio
13 / 47
Frontiera di Pareto
Dietro
Scegli i modelli da confrontare
Pubblicazioni (2)
arXiv
dicembre 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
dicembre 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

Panoramica

jina-vlm è un modello vision-language multilingue da 2,4B parametri che raggiunge performance SOTA di VQA tra i VLM open a scala 2B. Accoppia un vision encoder SigLIP2 a un decoder di linguaggio Qwen3 tramite un connettore attention-pooling che abilita un'elaborazione efficiente in termini di token di immagini a risoluzione arbitraria. Il modello supporta 29 lingue e un contesto di 32K token, rendendolo adatto alla comprensione dei documenti, all'analisi di grafici, all'OCR e al visual question answering multilingue.

Metodi

L'architettura combina un vision encoder SigLIP2 con un decoder di linguaggio Qwen3, connessi da un meccanismo attention-pooling che abilita un'elaborazione efficiente in termini di token di immagini a risoluzione arbitraria. L'innovazione chiave è il connettore attention-pooling, che applica pooling 2×2 per ridurre 729 token visivi per tile a 182 (una riduzione di 4× in token), ottenendo una riduzione di 3,9× dei FLOPs di prefill LLM e una riduzione di 4× della memoria KV-cache con impatto minimo sui punteggi dei benchmark. Le immagini vengono elaborate tramite tiling: le immagini a risoluzione arbitraria vengono suddivise in un massimo di 12 tile più una thumbnail, ciascuna elaborata indipendentemente e poi combinata. Il modello è stato addestrato su un dataset di VQA multilingue diversificato che copre 29 lingue (arabo, cinese, inglese, portoghese, russo, turco e altre). Uno studio di ablazione del data mixture leave-one-out ha diagnosticato quali categorie di dati (task, dominio, modalità, lingua) sono necessarie rispetto a ridondanti, guidando l'allocazione efficiente dei dati.

Prestazione

Il modello raggiunge il punteggio medio più alto (72,3) su otto benchmark di VQA tra i VLM a scala 2B: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) e MME (1582). Prende il comando nella comprensione multimodale multilingue: MMMB (78,8) e Multilingual MMBench (74,3), coprendo arabo, cinese, inglese, portoghese, russo e turco. La performance OCR è forte con 778 su OCRBench (scala 0–1000). La performance solo testo è competitiva: MMLU (54,7), HellaSwag (75,6), sebbene degradata su MMLU-Pro (30,3 contro 46,4 base) a causa dell'integrazione vision-language. La riduzione di 4× in token dell'attention pooling produce una riduzione di 3,9× dei FLOPs di prefill LLM e una riduzione di 4× della memoria KV-cache con impatto minimo sui benchmark.

Orientamento

Il modello è disponibile su Hugging Face sotto CC-BY-NC-4.0 con pesi e codice di inferenza. Supporta immagini a risoluzione arbitraria tramite tiling automatico (fino a 12 tile più thumbnail). Usa la modalità di ragionamento abilitando do_sample=True e temperature > 0 per task di ragionamento complessi. Il modello gestisce una lunghezza di contesto di 32K per conversazioni estese. Per la VQA multilingue, supporta 29 lingue, tra cui inglese, cinese, arabo, tedesco, spagnolo, francese, italiano, giapponese, coreano, portoghese, russo, turco, vietnamita, tailandese, indonesiano, hindi e bengalese. Più adatto alla comprensione dei documenti, all'analisi di grafici/diagrammi, ai task di OCR e al visual question answering multilingue. Limiti: i task di conteggio e il ragionamento spaziale a grana fine possono essere influenzati dall'approccio di tiling. Per un'inferenza ottimale, usa la precisione bfloat16 su GPU con supporto CUDA. L'inferenza MLX è supportata per Apple Silicon. Per la retrieval basata su embedding di documenti visivi, abbinalo a jina-embeddings-v4 o jina-reranker-m0.

Blog che menzionano questo modello
dicembre 04, 2025 • 7 minuti letti
Jina-VLM: Modello di linguaggio visivo multilingue di piccole dimensioni
Un nuovo modello di linguaggio visivo da 2B raggiunge lo SOTA sul VQA multilingue, senza perdita catastrofica di informazioni sulle attività di solo testo.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.