Aperçu
jina-vlm est un modèle de vision-langage multilingue de 2,4B paramètres atteignant des performances SOTA de VQA parmi les VLMs ouverts à l'échelle 2B. Il associe un vision encoder SigLIP2 à un décodeur de langage Qwen3 par le biais d'un connecteur d'attention-pooling qui permet un traitement efficace en tokens d'images de résolution arbitraire. Le modèle prend en charge 29 langues et un contexte de 32K tokens, ce qui le rend adapté à la compréhension de documents, l'analyse de graphiques, l'OCR et la réponse visuelle à des questions multilingues.
Méthodes
L'architecture combine un vision encoder SigLIP2 avec un décodeur de langage Qwen3, reliés par un mécanisme d'attention-pooling qui permet un traitement efficace en tokens d'images de résolution arbitraire. L'innovation clé est le connecteur d'attention-pooling, qui applique un pooling 2×2 pour réduire 729 tokens visuels par tuile à 182 (une réduction de 4× en tokens), produisant une réduction de 3,9× des FLOPs de préfill LLM et une réduction de 4× de la mémoire KV-cache avec un impact minimal sur les scores de benchmarks. Les images sont traitées par tuilage : les images de résolution arbitraire sont divisées en jusqu'à 12 tuiles plus une vignette, chacune traitée indépendamment puis combinée. Le modèle a été entraîné sur un jeu de données de VQA multilingue diversifié couvrant 29 langues (arabe, chinois, anglais, portugais, russe, turc et autres). Une étude d'ablation de mélange de données leave-one-out a diagnostiqué quelles catégories de données (tâche, domaine, modalité, langue) sont nécessaires par rapport à redondantes, guidant une allocation efficace des données.
Performance
Le modèle atteint le score moyen le plus élevé (72,3) sur huit benchmarks de VQA parmi les VLMs à l'échelle 2B : MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) et MME (1582). Il mène en compréhension multimodale multilingue : MMMB (78,8) et Multilingual MMBench (74,3), couvrant arabe, chinois, anglais, portugais, russe et turc. La performance OCR est forte avec 778 sur OCRBench (échelle 0–1000). La performance texte seul est compétitive : MMLU (54,7), HellaSwag (75,6), bien que dégradée sur MMLU-Pro (30,3 contre 46,4 base) en raison de l'intégration vision-langage. La réduction de 4× en tokens de l'attention pooling produit une réduction de 3,9× des FLOPs de préfill LLM et une réduction de 4× de la mémoire KV-cache avec un impact minimal sur les benchmarks.
Conseils
Le modèle est disponible sur Hugging Face sous CC-BY-NC-4.0 avec poids et code d'inférence. Il prend en charge les images de résolution arbitraire par tiling automatique (jusqu'à 12 tuiles plus vignette). Utilisez le mode de réflexion en activant do_sample=True et temperature > 0 pour les tâches de raisonnement complexe. Le modèle gère une longueur de contexte de 32K pour les conversations étendues. Pour la VQA multilingue, il prend en charge 29 langues, dont l'anglais, le chinois, l'arabe, l'allemand, l'espagnol, le français, l'italien, le japonais, le coréen, le portugais, le russe, le turc, le vietnamien, le thaï, l'indonésien, le hindi et le bengali. Mieux adapté à la compréhension de documents, l'analyse de graphiques/schémas, les tâches d'OCR et la réponse visuelle à des questions multilingues. Limites : les tâches de comptage et le raisonnement spatial de fine granularité peuvent être affectés par l'approche de tiling. Pour une inférence optimale, utilisez la précision bfloat16 sur des GPU compatibles CUDA. L'inférence MLX est prise en charge pour Apple Silicon. Pour la récupération basée sur les embeddings sur des documents visuels, associez-le à jina-embeddings-v4 ou jina-reranker-m0.




