Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyAgentidata_objectSchemamenu_bookDocumenti



Login
login
Lettore
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

jina-vlm

Modello di visione multilingue per la risposta visiva alle domande
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2025-12-04
Ingresso
image
Immagine
abc
Testo
arrow_forward
Produzione
abc
Testo
Dettagli del modello
Parametri: 2.4B
Lunghezza del token di input: 32K
Dimensione immagine di input: 4096×4096
Modello base help_outline
open_in_new
Qwen3-1.7B-Base
Lingue addestrate help_outline
39 lingue
Lingue supportate help_outline
93 lingue
Supporto Apple Silicon help_outline
MLX
Modelli correlati
link
jina-embeddings-v4
link
jina-reranker-m0
Disponibile tramite
API di Jina
Hugging Face
Air-gapped
Grafico I/O 1

Immagine

jina-vlm

Testo

Testo

Grafico I/O 2

Testo

jina-vlm

Testo

Scegli i modelli da confrontare
Pubblicazioni (2)
arXiv
dicembre 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
dicembre 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

Panoramica

jina-vlm è un modello visione-linguaggio da 2,4 miliardi di parametri che raggiunge lo stato dell'arte nella risposta visiva alle domande multilingue tra i VLM aperti su scala 2B. Il modello accoppia un encoder di visione SigLIP2-So400M (449 milioni di parametri) con un backbone linguistico Qwen3-1.7B attraverso un connettore di attention pooling che riduce i token visivi di 4 volte, preservando al contempo le informazioni spaziali. Utilizzando il tiling sovrapposto delle immagini con 12 riquadri più una miniatura globale, elabora immagini con risoluzione arbitraria fino a 4K. I dati di addestramento comprendono circa 5 milioni di campioni multimodali e 12 miliardi di token di testo in 29 lingue, di cui circa la metà in inglese e il resto in lingue ad alto e medio utilizzo di risorse, tra cui cinese, arabo, tedesco, spagnolo, francese, italiano, giapponese, coreano e altre ancora.

Metodi

L'addestramento avviene in due fasi, con tutti i componenti del modello (codificatore, connettore, decodificatore) aggiornati senza blocchi. La fase 1 (addestramento di allineamento) si concentra sul fondamento semantico interlinguistico utilizzando set di dati di didascalie (PixmoCap, PangeaIns) che abbracciano scene naturali, documenti, infografiche e diagrammi, con il 15% di dati solo testo per mitigare il degrado nelle attività solo testo. Il connettore utilizza un tasso di apprendimento più elevato e un riscaldamento più breve rispetto a codificatore e decodificatore. La fase 2 (ottimizzazione delle istruzioni) adatta il modello al VQA conversazionale utilizzando set di dati istruzione-risposta multilingue (Aya, ShareGPT4V, LLaVA). Il connettore di pooling dell'attenzione applica il pooling 2x2 per ridurre 729 token visivi per riquadro a 182 token, ottenendo una riduzione di 4x token con una perdita minima di prestazioni. Il tiling sovrapposto con una sovrapposizione di circa il 30% (112 pixel, passo 266) e 378x378 riquadri preserva le informazioni sui bordi.

Prestazione

Ottiene il punteggio medio più alto (72,3) in otto benchmark VQA tra i VLM su scala 2B, tra cui MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778) e MME (1582). È leader nella comprensione multimodale multilingue con MMMB (78,8) e Multilingual MMBench (74,3), coprendo arabo, cinese, inglese, portoghese, russo e turco. Ottime prestazioni OCR con 778 su OCRBench (scala 0-1000). Prestazioni competitive solo testo su MMLU (54,7) e HellaSwag (75,6), sebbene mostri il previsto degrado su MMLU-Pro (30,3 vs 46,4 base) a causa dell'integrazione tra visione e linguaggio. La riduzione di 4x dei token derivante dall'attention pooling produce una riduzione di 3,9x nei FLOP di precompilazione LLM e una riduzione di 4x nella memoria cache KV con un impatto minimo sui punteggi di benchmark.

Orientamento

Il modello è disponibile su Hugging Face con licenza CC-BY-NC-4.0 con pesi e codice di inferenza. Supporta immagini di risoluzione arbitraria tramite tiling automatico (fino a 12 tile più miniatura). Utilizza la modalità di pensiero abilitando do_sample=True e temperature > 0 per attività di ragionamento complesse. Il modello gestisce una lunghezza di contesto di 32K per conversazioni estese. Per VQA multilingue, il modello supporta 29 lingue, tra cui inglese, cinese, arabo, tedesco, spagnolo, francese, italiano, giapponese, coreano, portoghese, russo, turco, vietnamita, tailandese, indonesiano, hindi e bengalese. Ideale per la comprensione di documenti, l'analisi di grafici/diagrammi, attività OCR e risposte visive a domande multilingue. Il modello mostra limitazioni nelle attività di conteggio e nel ragionamento spaziale a grana fine dovute all'approccio tiling. Per un'inferenza ottimale, utilizzare la precisione bfloat16 su GPU compatibili con CUDA.
Blog che menzionano questo modello
dicembre 04, 2025 • 7 minuti letti
Jina-VLM: Modello di linguaggio visivo multilingue di piccole dimensioni
Un nuovo modello di linguaggio visivo da 2B raggiunge lo SOTA sul VQA multilingue, senza perdita catastrofica di informazioni sulle attività di solo testo.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.