Grafico I/O 1
Grafico I/O 2
Scegli i modelli da confrontare
Pubblicazioni (2)
Panoramica
jina-vlm è un modello visione-linguaggio da 2,4 miliardi di parametri che raggiunge lo stato dell'arte nella risposta visiva alle domande multilingue tra i VLM aperti su scala 2B. Il modello accoppia un encoder di visione SigLIP2-So400M (449 milioni di parametri) con un backbone linguistico Qwen3-1.7B attraverso un connettore di attention pooling che riduce i token visivi di 4 volte, preservando al contempo le informazioni spaziali. Utilizzando il tiling sovrapposto delle immagini con 12 riquadri più una miniatura globale, elabora immagini con risoluzione arbitraria fino a 4K. I dati di addestramento comprendono circa 5 milioni di campioni multimodali e 12 miliardi di token di testo in 29 lingue, di cui circa la metà in inglese e il resto in lingue ad alto e medio utilizzo di risorse, tra cui cinese, arabo, tedesco, spagnolo, francese, italiano, giapponese, coreano e altre ancora.
Metodi
L'addestramento avviene in due fasi, con tutti i componenti del modello (codificatore, connettore, decodificatore) aggiornati senza blocchi. La fase 1 (addestramento di allineamento) si concentra sul fondamento semantico interlinguistico utilizzando set di dati di didascalie (PixmoCap, PangeaIns) che abbracciano scene naturali, documenti, infografiche e diagrammi, con il 15% di dati solo testo per mitigare il degrado nelle attività solo testo. Il connettore utilizza un tasso di apprendimento più elevato e un riscaldamento più breve rispetto a codificatore e decodificatore. La fase 2 (ottimizzazione delle istruzioni) adatta il modello al VQA conversazionale utilizzando set di dati istruzione-risposta multilingue (Aya, ShareGPT4V, LLaVA). Il connettore di pooling dell'attenzione applica il pooling 2x2 per ridurre 729 token visivi per riquadro a 182 token, ottenendo una riduzione di 4x token con una perdita minima di prestazioni. Il tiling sovrapposto con una sovrapposizione di circa il 30% (112 pixel, passo 266) e 378x378 riquadri preserva le informazioni sui bordi.
Prestazione
Ottiene il punteggio medio più alto (72,3) in otto benchmark VQA tra i VLM su scala 2B, tra cui MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778) e MME (1582). È leader nella comprensione multimodale multilingue con MMMB (78,8) e Multilingual MMBench (74,3), coprendo arabo, cinese, inglese, portoghese, russo e turco. Ottime prestazioni OCR con 778 su OCRBench (scala 0-1000). Prestazioni competitive solo testo su MMLU (54,7) e HellaSwag (75,6), sebbene mostri il previsto degrado su MMLU-Pro (30,3 vs 46,4 base) a causa dell'integrazione tra visione e linguaggio. La riduzione di 4x dei token derivante dall'attention pooling produce una riduzione di 3,9x nei FLOP di precompilazione LLM e una riduzione di 4x nella memoria cache KV con un impatto minimo sui punteggi di benchmark.
Orientamento
Il modello è disponibile su Hugging Face con licenza CC-BY-NC-4.0 con pesi e codice di inferenza. Supporta immagini di risoluzione arbitraria tramite tiling automatico (fino a 12 tile più miniatura). Utilizza la modalità di pensiero abilitando do_sample=True e temperature > 0 per attività di ragionamento complesse. Il modello gestisce una lunghezza di contesto di 32K per conversazioni estese. Per VQA multilingue, il modello supporta 29 lingue, tra cui inglese, cinese, arabo, tedesco, spagnolo, francese, italiano, giapponese, coreano, portoghese, russo, turco, vietnamita, tailandese, indonesiano, hindi e bengalese. Ideale per la comprensione di documenti, l'analisi di grafici/diagrammi, attività OCR e risposte visive a domande multilingue. Il modello mostra limitazioni nelle attività di conteggio e nel ragionamento spaziale a grana fine dovute all'approccio tiling. Per un'inferenza ottimale, utilizzare la precisione bfloat16 su GPU compatibili con CUDA.
Blog che menzionano questo modello




