Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reranker
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Ingestion de données
copyright CC BY-NC 4.0
open_in_new Article de lancement

jina-vlm

Modèle vision-langage multilingue pour la réponse aux questions visuelles
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2025-12-04
Saisie
image
Image
abc
Texte
arrow_forward
Sortir
abc
Texte
Détails du modèle
Paramètres: 2.4B
Longueur du token d'entrée: 32K
Taille de l'image d'entrée: 4096×4096
Modèle de base help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
Langues enseignées help_outline
39 langues
Langues prises en charge help_outline
93 langues
Prise en charge d'Apple Silicon help_outline
MLX
Modèles associés
link
jina-embeddings-v4
link
jina-reranker-m0
Disponible via
API Jina
Hugging Face
Air-gapped
Graphique d'E/S 1

Image

jina-vlm

Texte

Texte

Graphique d'E/S 2

Texte

jina-vlm

Texte

Frontière de Pareto help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlmParamètres (log)accuracy
Ce modèle
Sur la frontière
Jina AI
Autres
AI2D
82.00
Paramètres
2.5B
Rang par score
13 / 47
Frontière de Pareto
Derrière
Choisissez les modèles à comparer
Publications (2)
arXiv
décembre 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
décembre 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

Aperçu

jina-vlm est un modèle de vision-langage multilingue de 2,4B paramètres atteignant des performances SOTA de VQA parmi les VLMs ouverts à l'échelle 2B. Il associe un vision encoder SigLIP2 à un décodeur de langage Qwen3 par le biais d'un connecteur d'attention-pooling qui permet un traitement efficace en tokens d'images de résolution arbitraire. Le modèle prend en charge 29 langues et un contexte de 32K tokens, ce qui le rend adapté à la compréhension de documents, l'analyse de graphiques, l'OCR et la réponse visuelle à des questions multilingues.

Méthodes

L'architecture combine un vision encoder SigLIP2 avec un décodeur de langage Qwen3, reliés par un mécanisme d'attention-pooling qui permet un traitement efficace en tokens d'images de résolution arbitraire. L'innovation clé est le connecteur d'attention-pooling, qui applique un pooling 2×2 pour réduire 729 tokens visuels par tuile à 182 (une réduction de 4× en tokens), produisant une réduction de 3,9× des FLOPs de préfill LLM et une réduction de 4× de la mémoire KV-cache avec un impact minimal sur les scores de benchmarks. Les images sont traitées par tuilage : les images de résolution arbitraire sont divisées en jusqu'à 12 tuiles plus une vignette, chacune traitée indépendamment puis combinée. Le modèle a été entraîné sur un jeu de données de VQA multilingue diversifié couvrant 29 langues (arabe, chinois, anglais, portugais, russe, turc et autres). Une étude d'ablation de mélange de données leave-one-out a diagnostiqué quelles catégories de données (tâche, domaine, modalité, langue) sont nécessaires par rapport à redondantes, guidant une allocation efficace des données.

Performance

Le modèle atteint le score moyen le plus élevé (72,3) sur huit benchmarks de VQA parmi les VLMs à l'échelle 2B : MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) et MME (1582). Il mène en compréhension multimodale multilingue : MMMB (78,8) et Multilingual MMBench (74,3), couvrant arabe, chinois, anglais, portugais, russe et turc. La performance OCR est forte avec 778 sur OCRBench (échelle 0–1000). La performance texte seul est compétitive : MMLU (54,7), HellaSwag (75,6), bien que dégradée sur MMLU-Pro (30,3 contre 46,4 base) en raison de l'intégration vision-langage. La réduction de 4× en tokens de l'attention pooling produit une réduction de 3,9× des FLOPs de préfill LLM et une réduction de 4× de la mémoire KV-cache avec un impact minimal sur les benchmarks.

Conseils

Le modèle est disponible sur Hugging Face sous CC-BY-NC-4.0 avec poids et code d'inférence. Il prend en charge les images de résolution arbitraire par tiling automatique (jusqu'à 12 tuiles plus vignette). Utilisez le mode de réflexion en activant do_sample=True et temperature > 0 pour les tâches de raisonnement complexe. Le modèle gère une longueur de contexte de 32K pour les conversations étendues. Pour la VQA multilingue, il prend en charge 29 langues, dont l'anglais, le chinois, l'arabe, l'allemand, l'espagnol, le français, l'italien, le japonais, le coréen, le portugais, le russe, le turc, le vietnamien, le thaï, l'indonésien, le hindi et le bengali. Mieux adapté à la compréhension de documents, l'analyse de graphiques/schémas, les tâches d'OCR et la réponse visuelle à des questions multilingues. Limites : les tâches de comptage et le raisonnement spatial de fine granularité peuvent être affectés par l'approche de tiling. Pour une inférence optimale, utilisez la précision bfloat16 sur des GPU compatibles CUDA. L'inférence MLX est prise en charge pour Apple Silicon. Pour la récupération basée sur les embeddings sur des documents visuels, associez-le à jina-embeddings-v4 ou jina-reranker-m0.

Blogs qui mentionnent ce modèle
décembre 04, 2025 • 7 minutes lues
Jina-VLM : Petit modèle de langage visuel multilingue
Nouveau modèle de langage de vision 2B atteint SOTA sur VQA multilingue, sans oubli catastrophique sur les tâches textuelles uniquement.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reranker
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.