Panoramica
jina-vlm è un modello vision-language multilingue da 2,4B parametri che raggiunge performance SOTA di VQA tra i VLM open a scala 2B. Accoppia un vision encoder SigLIP2 a un decoder di linguaggio Qwen3 tramite un connettore attention-pooling che abilita un'elaborazione efficiente in termini di token di immagini a risoluzione arbitraria. Il modello supporta 29 lingue e un contesto di 32K token, rendendolo adatto alla comprensione dei documenti, all'analisi di grafici, all'OCR e al visual question answering multilingue.
Metodi
L'architettura combina un vision encoder SigLIP2 con un decoder di linguaggio Qwen3, connessi da un meccanismo attention-pooling che abilita un'elaborazione efficiente in termini di token di immagini a risoluzione arbitraria. L'innovazione chiave è il connettore attention-pooling, che applica pooling 2×2 per ridurre 729 token visivi per tile a 182 (una riduzione di 4× in token), ottenendo una riduzione di 3,9× dei FLOPs di prefill LLM e una riduzione di 4× della memoria KV-cache con impatto minimo sui punteggi dei benchmark. Le immagini vengono elaborate tramite tiling: le immagini a risoluzione arbitraria vengono suddivise in un massimo di 12 tile più una thumbnail, ciascuna elaborata indipendentemente e poi combinata. Il modello è stato addestrato su un dataset di VQA multilingue diversificato che copre 29 lingue (arabo, cinese, inglese, portoghese, russo, turco e altre). Uno studio di ablazione del data mixture leave-one-out ha diagnosticato quali categorie di dati (task, dominio, modalità, lingua) sono necessarie rispetto a ridondanti, guidando l'allocazione efficiente dei dati.
Prestazione
Il modello raggiunge il punteggio medio più alto (72,3) su otto benchmark di VQA tra i VLM a scala 2B: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) e MME (1582). Prende il comando nella comprensione multimodale multilingue: MMMB (78,8) e Multilingual MMBench (74,3), coprendo arabo, cinese, inglese, portoghese, russo e turco. La performance OCR è forte con 778 su OCRBench (scala 0–1000). La performance solo testo è competitiva: MMLU (54,7), HellaSwag (75,6), sebbene degradata su MMLU-Pro (30,3 contro 46,4 base) a causa dell'integrazione vision-language. La riduzione di 4× in token dell'attention pooling produce una riduzione di 3,9× dei FLOPs di prefill LLM e una riduzione di 4× della memoria KV-cache con impatto minimo sui benchmark.
Orientamento
Il modello è disponibile su Hugging Face sotto CC-BY-NC-4.0 con pesi e codice di inferenza. Supporta immagini a risoluzione arbitraria tramite tiling automatico (fino a 12 tile più thumbnail). Usa la modalità di ragionamento abilitando do_sample=True e temperature > 0 per task di ragionamento complessi. Il modello gestisce una lunghezza di contesto di 32K per conversazioni estese. Per la VQA multilingue, supporta 29 lingue, tra cui inglese, cinese, arabo, tedesco, spagnolo, francese, italiano, giapponese, coreano, portoghese, russo, turco, vietnamita, tailandese, indonesiano, hindi e bengalese. Più adatto alla comprensione dei documenti, all'analisi di grafici/diagrammi, ai task di OCR e al visual question answering multilingue. Limiti: i task di conteggio e il ragionamento spaziale a grana fine possono essere influenzati dall'approccio di tiling. Per un'inferenza ottimale, usa la precisione bfloat16 su GPU con supporto CUDA. L'inferenza MLX è supportata per Apple Silicon. Per la retrieval basata su embedding di documenti visivi, abbinalo a jina-embeddings-v4 o jina-reranker-m0.




