Descripción general
jina-vlm es un modelo de visión-lenguaje multilingüe de 2,4B parámetros que alcanza un rendimiento SOTA de VQA entre los VLMs abiertos a escala 2B. Acopla un vision encoder SigLIP2 con un decodificador de lenguaje Qwen3 a través de un conector de attention-pooling que permite un procesamiento eficiente en tokens de imágenes de resolución arbitraria. El modelo soporta 29 idiomas y un contexto de 32K tokens, lo que lo hace adecuado para la comprensión de documentos, el análisis de gráficos, OCR y respuesta visual a preguntas multilingüe.
Métodos
La arquitectura combina un vision encoder SigLIP2 con un decodificador de lenguaje Qwen3, conectados por un mecanismo de attention-pooling que permite un procesamiento eficiente en tokens de imágenes de resolución arbitraria. La clave de la innovación es el conector de attention-pooling, que aplica pooling 2×2 para reducir 729 tokens visuales por mosaico a 182 (una reducción de 4× en tokens), logrando una reducción de 3,9× en FLOPs de prefill LLM y una reducción de 4× en memoria KV-cache con impacto mínimo en las puntuaciones de benchmarks. Las imágenes se procesan mediante tiling: las imágenes de resolución arbitraria se dividen en hasta 12 mosaicos más una miniatura, cada una procesada de forma independiente y luego combinada. El modelo se entrenó en un conjunto de datos de VQA multilingüe diverso que cubre 29 idiomas (árabe, chino, inglés, portugués, ruso, turco y otros). Un estudio de ablación de mezcla de datos leave-one-out diagnosticó qué categorías de datos (tarea, dominio, modalidad, idioma) son necesarias versus redundantes, guiando la asignación eficiente de datos.
Rendimiento
El modelo logra la puntuación promedio más alta (72,3) en ocho benchmarks de VQA entre VLMs a escala 2B: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) y MME (1582). Lidera en la comprensión multimodal multilingüe: MMMB (78,8) y Multilingual MMBench (74,3), cubriendo árabe, chino, inglés, portugués, ruso y turco. El rendimiento OCR es fuerte con 778 en OCRBench (escala 0–1000). El rendimiento solo de texto es competitivo: MMLU (54,7), HellaSwag (75,6), aunque degradado en MMLU-Pro (30,3 frente a 46,4 base) debido a la integración visión-lenguaje. La reducción de 4× en tokens del attention pooling logra una reducción de 3,9× en FLOPs de prefill LLM y una reducción de 4× en memoria KV-cache con impacto mínimo en los benchmarks.
Guía
El modelo está disponible en Hugging Face bajo CC-BY-NC-4.0 con pesos y código de inferencia. Soporta imágenes de resolución arbitraria mediante tiling automático (hasta 12 mosaicos más miniatura). Use el modo de pensamiento activando do_sample=True y temperature > 0 para tareas de razonamiento complejo. El modelo maneja una longitud de contexto de 32K para conversaciones extendidas. Para VQA multilingüe, soporta 29 idiomas, incluyendo inglés, chino, árabe, alemán, español, francés, italiano, japonés, coreano, portugués, ruso, turco, vietnamita, tailandés, indonesio, hindi y bengalí. Más adecuado para la comprensión de documentos, el análisis de gráficos/diagramas, tareas de OCR y respuesta visual a preguntas multilingüe. Limitaciones: las tareas de conteo y el razonamiento espacial de grano fino pueden verse afectadas por el enfoque de tiling. Para inferencia óptima, use precisión bfloat16 en GPUs con soporte CUDA. Se soporta inferencia MLX para Apple Silicon. Para recuperación basada en embeddings sobre documentos visuales, combínelo con jina-embeddings-v4 o jina-reranker-m0.




