Graphique d'E/S 1
Graphique d'E/S 2
Choisissez les modèles à comparer
Publications (2)
Aperçu
Jina-VLM est un modèle vision-langage à 2,4 milliards de paramètres qui atteint des performances de pointe en matière de réponse visuelle multilingue aux questions parmi les modèles VLM ouverts à l'échelle de 2 milliards de paramètres. Ce modèle associe un encodeur visuel SigLIP2-So400M (449 millions de paramètres) à une architecture de langage Qwen3-1,7B via un connecteur de mise en commun de l'attention qui réduit le nombre de jetons visuels d'un facteur 4 tout en préservant les informations spatiales. Utilisant un pavage d'images superposées avec 12 tuiles et une vignette globale, il traite des images de résolution arbitraire jusqu'à 4K. Les données d'entraînement comprennent environ 5 millions d'échantillons multimodaux et 12 milliards de jetons textuels dans 29 langues, dont environ la moitié en anglais et le reste couvrant des langues à ressources élevées et moyennes, notamment le chinois, l'arabe, l'allemand, l'espagnol, le français, l'italien, le japonais, le coréen, etc.
Méthodes
L'entraînement se déroule en deux étapes, tous les composants du modèle (encodeur, connecteur, décodeur) étant mis à jour sans gel. La première étape (alignement) se concentre sur l'ancrage sémantique interlingue à l'aide de jeux de données de légendes (PixmoCap, PangeaIns) couvrant des scènes naturelles, des documents, des infographies et des diagrammes, avec 15 % de données textuelles uniquement pour limiter la dégradation des performances sur les tâches ne comportant que du texte. Le connecteur utilise un taux d'apprentissage plus élevé et une période d'échauffement plus courte que l'encodeur et le décodeur. La deuxième étape (instruction tuning) adapte le modèle à la VQA conversationnelle à l'aide de jeux de données multilingues d'instructions et de réponses (Aya, ShareGPT4V, LLaVA). Le connecteur à attention-pooling applique un pooling 2×2 pour réduire le nombre de tokens visuels par tuile de 729 à 182, soit une réduction de 4× avec une perte de performance minimale. Le pavage avec un chevauchement d'environ 30 % (112 pixels, pas de 266) et des tuiles de 378×378 préserve les informations de bord.
Performance
Obtient le score moyen le plus élevé (72,3) sur huit benchmarks VQA parmi les VLM ouverts à l'échelle 2B, notamment MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778) et MME (1582). Se distingue par ses performances en compréhension multilingue et multimodale avec MMMB (78,8) et Multilingual MMBench (74,3), couvrant l'arabe, le chinois, l'anglais, le portugais, le russe et le turc. Excellentes performances OCR avec un score de 778 sur OCRBench (échelle de 0 à 1000). Performances compétitives en texte seul sur MMLU (54,7) et HellaSwag (75,6), malgré une dégradation attendue sur MMLU-Pro (30,3 contre 46,4 pour le modèle de base) due à l'intégration vision-langage. La réduction de 4× du nombre de tokens grâce à l'attention pooling permet une réduction de 3,9× des FLOP de préremplissage du LLM et une réduction de 4× de la mémoire du cache KV, avec un impact minimal sur les scores de benchmark.
Conseils
Le modèle est disponible sur Hugging Face sous licence CC-BY-NC-4.0, avec les poids et le code d'inférence. Il prend en charge les images de résolution arbitraire grâce au pavage automatique (jusqu'à 12 tuiles plus une vignette). Pour les tâches de raisonnement complexes, activez le mode « réflexion » en définissant `do_sample=True` et `temperature > 0`. Le modèle gère une longueur de contexte de 32 Ko pour les conversations étendues. Pour la réponse visuelle multilingue, il prend en charge 29 langues, dont l'anglais, le chinois, l'arabe, l'allemand, l'espagnol, le français, l'italien, le japonais, le coréen, le portugais, le russe, le turc, le vietnamien, le thaï, l'indonésien, l'hindi et le bengali. Il est particulièrement adapté à la compréhension de documents, à l'analyse de graphiques et de diagrammes, aux tâches de reconnaissance optique de caractères (OCR) et à la réponse visuelle multilingue. Le modèle présente des limitations pour les tâches de comptage et le raisonnement spatial fin en raison de son approche par pavage. Pour une inférence optimale, utilisez la précision bfloat16 sur les GPU compatibles CUDA.
Blogs qui mentionnent ce modèle




