Überblick
jina-vlm ist ein mehrsprachiges Vision-Language-Modell mit 2,4B Parametern, das State-of-the-Art-VQA-Performance unter offenen VLMs in 2B-Skala erreicht. Es koppelt einen SigLIP2-Vision-Encoder an einen Qwen3-Sprachdekoder über einen Attention-Pooling-Connector, der eine token-effiziente Verarbeitung von Bildern beliebiger Auflösung ermöglicht. Das Modell unterstützt 29 Sprachen und einen 32K-Token-Kontext, was es für Dokumentenverständnis, Diagrammanalyse, OCR und mehrsprachiges visuelles Frage-Antwort-Verfahren geeignet macht.
Methoden
Die Architektur kombiniert einen SigLIP2-Vision-Encoder mit einem Qwen3-Sprachdekoder, verbunden durch einen Attention-Pooling-Mechanismus, der eine token-effiziente Verarbeitung von Bildern beliebiger Auflösung ermöglicht. Die Schlüsselinnovation ist der Attention-Pooling-Connector, der 2×2-Pooling anwendet, um 729 visuelle Tokens pro Kachel auf 182 zu reduzieren (eine 4×-Token-Reduktion), was eine 3,9×-Reduktion der LLM-Prefill-FLOPs und eine 4×-Reduktion des KV-Cache-Speichers bei minimalem Einfluss auf Benchmark-Scores ergibt. Bilder werden per Tiling verarbeitet: Bilder beliebiger Auflösung werden in bis zu 12 Kacheln plus ein Thumbnail unterteilt, jede unabhängig verarbeitet und dann kombiniert. Das Modell wurde auf einem vielfältigen mehrsprachigen VQA-Datensatz trainiert, der 29 Sprachen abdeckt (Arabisch, Chinesisch, Englisch, Portugiesisch, Russisch, Türkisch und andere). Eine Leave-One-Out-Datenmischung-Ablationsstudie diagnostizierte, welche Datenkategorien (Task, Domain, Modalität, Sprache) notwendig versus redundant sind und leitete eine effiziente Datenallokation.
Leistung
Das Modell erzielt den höchsten Durchschnittswert (72,3) über acht VQA-Benchmarks unter VLMs in 2B-Skala: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) und MME (1582). Es führt beim mehrsprachigen multimodalen Verständnis an: MMMB (78,8) und Multilingual MMBench (74,3), mit Abdeckung von Arabisch, Chinesisch, Englisch, Portugiesisch, Russisch und Türkisch. Die OCR-Performance ist mit 778 auf OCRBench (Skala 0–1000) stark. Die nur-Text-Performance ist wettbewerbsfähig: MMLU (54,7), HellaSwag (75,6), wenn auch bei MMLU-Pro (30,3 gegenüber 46,4 Basis) wegen der Vision-Language-Integration eingeschränkt. Die 4×-Token-Reduktion durch Attention-Pooling ergibt eine 3,9×-Reduktion der LLM-Prefill-FLOPs und eine 4×-Reduktion des KV-Cache-Speichers bei minimalem Benchmark-Einfluss.
Anleitung
Das Modell ist auf Hugging Face unter CC-BY-NC-4.0 mit Gewichten und Inferenz-Code verfügbar. Es unterstützt Bilder beliebiger Auflösung durch automatisches Tiling (bis zu 12 Kacheln plus Thumbnail). Aktivieren Sie den Thinking-Modus durch do_sample=True und temperature > 0 für komplexe Inferenzaufgaben. Das Modell handhabt eine 32K-Kontextlänge für erweiterte Konversationen. Für mehrsprachiges VQA unterstützt es 29 Sprachen, darunter Englisch, Chinesisch, Arabisch, Deutsch, Spanisch, Französisch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch, Türkisch, Vietnamesisch, Thailändisch, Indonesisch, Hindi und Bengalisch. Am besten geeignet für Dokumentenverständnis, Chart-/Diagramm-Analyse, OCR-Aufgaben und mehrsprachiges visuelles Frage-Antwort. Einschränkungen: Zähl-Aufgaben und fein-körnige räumliche Inferenz können durch den Tiling-Ansatz beeinflusst sein. Für optimale Inferenz nutzen Sie bfloat16-Präzision auf CUDA-fähigen GPUs. MLX-Inferenz wird für Apple Silicon unterstützt. Für embedding-basiertes Retrieval visueller Dokumente paaren Sie es mit jina-embeddings-v4 oder jina-reranker-m0.




