Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyAgentsdata_objectSchémamenu_bookDocuments



Se connecter
login
Lecteur
copyright CC BY-NC 4.0
open_in_new Publication de publication

jina-vlm

Modèle vision-langage multilingue pour la réponse aux questions visuelles
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2025-12-04
Saisir
image
Image
abc
Texte
arrow_forward
Sortir
abc
Texte
Détails du modèle
Paramètres: 2.4B
Longueur du jeton d'entrée: 32K
Taille de l'image d'entrée: 4096×4096
Modèle de base help_outline
open_in_new
Qwen3-1.7B-Base
Langues enseignées help_outline
39 langues
Langues prises en charge help_outline
93 langues
Prise en charge d'Apple Silicon help_outline
MLX
Modèles associés
link
jina-embeddings-v4
link
jina-reranker-m0
Disponible via
API Jina
Hugging Face
Air-gapped
Graphique d'E/S 1

Image

jina-vlm

Texte

Texte

Graphique d'E/S 2

Texte

jina-vlm

Texte

Choisissez les modèles à comparer
Publications (2)
arXiv
décembre 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
décembre 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

Aperçu

Jina-VLM est un modèle vision-langage à 2,4 milliards de paramètres qui atteint des performances de pointe en matière de réponse visuelle multilingue aux questions parmi les modèles VLM ouverts à l'échelle de 2 milliards de paramètres. Ce modèle associe un encodeur visuel SigLIP2-So400M (449 millions de paramètres) à une architecture de langage Qwen3-1,7B via un connecteur de mise en commun de l'attention qui réduit le nombre de jetons visuels d'un facteur 4 tout en préservant les informations spatiales. Utilisant un pavage d'images superposées avec 12 tuiles et une vignette globale, il traite des images de résolution arbitraire jusqu'à 4K. Les données d'entraînement comprennent environ 5 millions d'échantillons multimodaux et 12 milliards de jetons textuels dans 29 langues, dont environ la moitié en anglais et le reste couvrant des langues à ressources élevées et moyennes, notamment le chinois, l'arabe, l'allemand, l'espagnol, le français, l'italien, le japonais, le coréen, etc.

Méthodes

L'entraînement se déroule en deux étapes, tous les composants du modèle (encodeur, connecteur, décodeur) étant mis à jour sans gel. La première étape (alignement) se concentre sur l'ancrage sémantique interlingue à l'aide de jeux de données de légendes (PixmoCap, PangeaIns) couvrant des scènes naturelles, des documents, des infographies et des diagrammes, avec 15 % de données textuelles uniquement pour limiter la dégradation des performances sur les tâches ne comportant que du texte. Le connecteur utilise un taux d'apprentissage plus élevé et une période d'échauffement plus courte que l'encodeur et le décodeur. La deuxième étape (instruction tuning) adapte le modèle à la VQA conversationnelle à l'aide de jeux de données multilingues d'instructions et de réponses (Aya, ShareGPT4V, LLaVA). Le connecteur à attention-pooling applique un pooling 2×2 pour réduire le nombre de tokens visuels par tuile de 729 à 182, soit une réduction de 4× avec une perte de performance minimale. Le pavage avec un chevauchement d'environ 30 % (112 pixels, pas de 266) et des tuiles de 378×378 préserve les informations de bord.

Performance

Obtient le score moyen le plus élevé (72,3) sur huit benchmarks VQA parmi les VLM ouverts à l'échelle 2B, notamment MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778) et MME (1582). Se distingue par ses performances en compréhension multilingue et multimodale avec MMMB (78,8) et Multilingual MMBench (74,3), couvrant l'arabe, le chinois, l'anglais, le portugais, le russe et le turc. Excellentes performances OCR avec un score de 778 sur OCRBench (échelle de 0 à 1000). Performances compétitives en texte seul sur MMLU (54,7) et HellaSwag (75,6), malgré une dégradation attendue sur MMLU-Pro (30,3 contre 46,4 pour le modèle de base) due à l'intégration vision-langage. La réduction de 4× du nombre de tokens grâce à l'attention pooling permet une réduction de 3,9× des FLOP de préremplissage du LLM et une réduction de 4× de la mémoire du cache KV, avec un impact minimal sur les scores de benchmark.

Conseils

Le modèle est disponible sur Hugging Face sous licence CC-BY-NC-4.0, avec les poids et le code d'inférence. Il prend en charge les images de résolution arbitraire grâce au pavage automatique (jusqu'à 12 tuiles plus une vignette). Pour les tâches de raisonnement complexes, activez le mode « réflexion » en définissant `do_sample=True` et `temperature > 0`. Le modèle gère une longueur de contexte de 32 Ko pour les conversations étendues. Pour la réponse visuelle multilingue, il prend en charge 29 langues, dont l'anglais, le chinois, l'arabe, l'allemand, l'espagnol, le français, l'italien, le japonais, le coréen, le portugais, le russe, le turc, le vietnamien, le thaï, l'indonésien, l'hindi et le bengali. Il est particulièrement adapté à la compréhension de documents, à l'analyse de graphiques et de diagrammes, aux tâches de reconnaissance optique de caractères (OCR) et à la réponse visuelle multilingue. Le modèle présente des limitations pour les tâches de comptage et le raisonnement spatial fin en raison de son approche par pavage. Pour une inférence optimale, utilisez la précision bfloat16 sur les GPU compatibles CUDA.
Blogs qui mentionnent ce modèle
décembre 04, 2025 • 7 minutes lues
Jina-VLM : Petit modèle de langage visuel multilingue
Nouveau modèle de langage de vision 2B atteint SOTA sur VQA multilingue, sans oubli catastrophique sur les tâches textuelles uniquement.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.