Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Datenaufnahme
copyright CC BY-NC 4.0
open_in_new Release-Post

jina-vlm

Mehrsprachiges Bild-Sprach-Modell für die visuelle Beantwortung von Fragen
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2025-12-04
Eingabe
image
Bild
abc
Text
arrow_forward
Ausgabe
abc
Text
Modelldetails
Parameter: 2.4B
Länge des Eingabetokens: 32K
Eingabebildgröße: 4096×4096
Basismodell help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
Ausgebildete Sprachen help_outline
39 Sprachen
Unterstützte Sprachen help_outline
93 Sprachen
Apple Silicon-Unterstützung help_outline
MLX
Ähnliche Modelle
link
jina-embeddings-v4
link
jina-reranker-m0
Erhältlich über
Jina-API
Hugging Face
Air-Gapped
E/A-Diagramm 1

Bild

jina-vlm

Text

Text

E/A-Diagramm 2

Text

jina-vlm

Text

Pareto-Front help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlmParameter (log)accuracy
Dieses Modell
Auf der Front
Jina AI
Andere
AI2D
82.00
Parameter
2.5B
Rang nach Score
13 / 47
Pareto-Front
Dahinter
Wählen Sie Modelle zum Vergleichen aus
Publikationen (2)
arXiv
Dezember 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
Dezember 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

Überblick

jina-vlm ist ein mehrsprachiges Vision-Language-Modell mit 2,4B Parametern, das State-of-the-Art-VQA-Performance unter offenen VLMs in 2B-Skala erreicht. Es koppelt einen SigLIP2-Vision-Encoder an einen Qwen3-Sprachdekoder über einen Attention-Pooling-Connector, der eine token-effiziente Verarbeitung von Bildern beliebiger Auflösung ermöglicht. Das Modell unterstützt 29 Sprachen und einen 32K-Token-Kontext, was es für Dokumentenverständnis, Diagrammanalyse, OCR und mehrsprachiges visuelles Frage-Antwort-Verfahren geeignet macht.

Methoden

Die Architektur kombiniert einen SigLIP2-Vision-Encoder mit einem Qwen3-Sprachdekoder, verbunden durch einen Attention-Pooling-Mechanismus, der eine token-effiziente Verarbeitung von Bildern beliebiger Auflösung ermöglicht. Die Schlüsselinnovation ist der Attention-Pooling-Connector, der 2×2-Pooling anwendet, um 729 visuelle Tokens pro Kachel auf 182 zu reduzieren (eine 4×-Token-Reduktion), was eine 3,9×-Reduktion der LLM-Prefill-FLOPs und eine 4×-Reduktion des KV-Cache-Speichers bei minimalem Einfluss auf Benchmark-Scores ergibt. Bilder werden per Tiling verarbeitet: Bilder beliebiger Auflösung werden in bis zu 12 Kacheln plus ein Thumbnail unterteilt, jede unabhängig verarbeitet und dann kombiniert. Das Modell wurde auf einem vielfältigen mehrsprachigen VQA-Datensatz trainiert, der 29 Sprachen abdeckt (Arabisch, Chinesisch, Englisch, Portugiesisch, Russisch, Türkisch und andere). Eine Leave-One-Out-Datenmischung-Ablationsstudie diagnostizierte, welche Datenkategorien (Task, Domain, Modalität, Sprache) notwendig versus redundant sind und leitete eine effiziente Datenallokation.

Leistung

Das Modell erzielt den höchsten Durchschnittswert (72,3) über acht VQA-Benchmarks unter VLMs in 2B-Skala: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) und MME (1582). Es führt beim mehrsprachigen multimodalen Verständnis an: MMMB (78,8) und Multilingual MMBench (74,3), mit Abdeckung von Arabisch, Chinesisch, Englisch, Portugiesisch, Russisch und Türkisch. Die OCR-Performance ist mit 778 auf OCRBench (Skala 0–1000) stark. Die nur-Text-Performance ist wettbewerbsfähig: MMLU (54,7), HellaSwag (75,6), wenn auch bei MMLU-Pro (30,3 gegenüber 46,4 Basis) wegen der Vision-Language-Integration eingeschränkt. Die 4×-Token-Reduktion durch Attention-Pooling ergibt eine 3,9×-Reduktion der LLM-Prefill-FLOPs und eine 4×-Reduktion des KV-Cache-Speichers bei minimalem Benchmark-Einfluss.

Anleitung

Das Modell ist auf Hugging Face unter CC-BY-NC-4.0 mit Gewichten und Inferenz-Code verfügbar. Es unterstützt Bilder beliebiger Auflösung durch automatisches Tiling (bis zu 12 Kacheln plus Thumbnail). Aktivieren Sie den Thinking-Modus durch do_sample=True und temperature > 0 für komplexe Inferenzaufgaben. Das Modell handhabt eine 32K-Kontextlänge für erweiterte Konversationen. Für mehrsprachiges VQA unterstützt es 29 Sprachen, darunter Englisch, Chinesisch, Arabisch, Deutsch, Spanisch, Französisch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch, Türkisch, Vietnamesisch, Thailändisch, Indonesisch, Hindi und Bengalisch. Am besten geeignet für Dokumentenverständnis, Chart-/Diagramm-Analyse, OCR-Aufgaben und mehrsprachiges visuelles Frage-Antwort. Einschränkungen: Zähl-Aufgaben und fein-körnige räumliche Inferenz können durch den Tiling-Ansatz beeinflusst sein. Für optimale Inferenz nutzen Sie bfloat16-Präzision auf CUDA-fähigen GPUs. MLX-Inferenz wird für Apple Silicon unterstützt. Für embedding-basiertes Retrieval visueller Dokumente paaren Sie es mit jina-embeddings-v4 oder jina-reranker-m0.

Blogs, die dieses Modell erwähnen
Dezember 04, 2025 • 7 Minuten gelesen
Jina-VLM: Kleines, mehrsprachiges Vision Language Model
Neues 2B Vision-Language-Modell erzielt SOTA bei mehrsprachigem VQA, kein katastrophales Vergessen bei reinen Textaufgaben.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.