Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Ingesta de datos
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

jina-vlm

Modelo multilingüe de visión y lenguaje para la respuesta visual a preguntas
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2025-12-04
Entrada
image
Imagen
abc
Texto
arrow_forward
Producción
abc
Texto
Detalles del modelo
Parámetros: 2.4B
Longitud del token de entrada: 32K
Tamaño de la imagen de entrada: 4096×4096
Modelo base help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
Idiomas entrenados help_outline
39 idiomas
Idiomas admitidos help_outline
93 idiomas
Soporte para Apple Silicon help_outline
MLX
Modelos relacionados
link
jina-embeddings-v4
link
jina-reranker-m0
Disponible a través de
API de Jina
Hugging Face
Air-gapped
Gráfico de E/S 1

Imagen

jina-vlm

Texto

Texto

Gráfico de E/S 2

Texto

jina-vlm

Texto

Frontera de Pareto help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlmParámetros (log)accuracy
Este modelo
En la frontera
Jina AI
Otros
AI2D
82.00
Parámetros
2.5B
Rango por score
13 / 47
Frontera de Pareto
Por detrás
Elija modelos para comparar
Publicaciones (2)
arXiv
diciembre 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
diciembre 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

Descripción general

jina-vlm es un modelo de visión-lenguaje multilingüe de 2,4B parámetros que alcanza un rendimiento SOTA de VQA entre los VLMs abiertos a escala 2B. Acopla un vision encoder SigLIP2 con un decodificador de lenguaje Qwen3 a través de un conector de attention-pooling que permite un procesamiento eficiente en tokens de imágenes de resolución arbitraria. El modelo soporta 29 idiomas y un contexto de 32K tokens, lo que lo hace adecuado para la comprensión de documentos, el análisis de gráficos, OCR y respuesta visual a preguntas multilingüe.

Métodos

La arquitectura combina un vision encoder SigLIP2 con un decodificador de lenguaje Qwen3, conectados por un mecanismo de attention-pooling que permite un procesamiento eficiente en tokens de imágenes de resolución arbitraria. La clave de la innovación es el conector de attention-pooling, que aplica pooling 2×2 para reducir 729 tokens visuales por mosaico a 182 (una reducción de 4× en tokens), logrando una reducción de 3,9× en FLOPs de prefill LLM y una reducción de 4× en memoria KV-cache con impacto mínimo en las puntuaciones de benchmarks. Las imágenes se procesan mediante tiling: las imágenes de resolución arbitraria se dividen en hasta 12 mosaicos más una miniatura, cada una procesada de forma independiente y luego combinada. El modelo se entrenó en un conjunto de datos de VQA multilingüe diverso que cubre 29 idiomas (árabe, chino, inglés, portugués, ruso, turco y otros). Un estudio de ablación de mezcla de datos leave-one-out diagnosticó qué categorías de datos (tarea, dominio, modalidad, idioma) son necesarias versus redundantes, guiando la asignación eficiente de datos.

Rendimiento

El modelo logra la puntuación promedio más alta (72,3) en ocho benchmarks de VQA entre VLMs a escala 2B: MathVista (59,4), AI2D (80,8), ChartQA (79,5), DocVQA (90,6), InfoVQA (65,9), RealWorldQA (64,9), OCRBench (778/1000) y MME (1582). Lidera en la comprensión multimodal multilingüe: MMMB (78,8) y Multilingual MMBench (74,3), cubriendo árabe, chino, inglés, portugués, ruso y turco. El rendimiento OCR es fuerte con 778 en OCRBench (escala 0–1000). El rendimiento solo de texto es competitivo: MMLU (54,7), HellaSwag (75,6), aunque degradado en MMLU-Pro (30,3 frente a 46,4 base) debido a la integración visión-lenguaje. La reducción de 4× en tokens del attention pooling logra una reducción de 3,9× en FLOPs de prefill LLM y una reducción de 4× en memoria KV-cache con impacto mínimo en los benchmarks.

Guía

El modelo está disponible en Hugging Face bajo CC-BY-NC-4.0 con pesos y código de inferencia. Soporta imágenes de resolución arbitraria mediante tiling automático (hasta 12 mosaicos más miniatura). Use el modo de pensamiento activando do_sample=True y temperature > 0 para tareas de razonamiento complejo. El modelo maneja una longitud de contexto de 32K para conversaciones extendidas. Para VQA multilingüe, soporta 29 idiomas, incluyendo inglés, chino, árabe, alemán, español, francés, italiano, japonés, coreano, portugués, ruso, turco, vietnamita, tailandés, indonesio, hindi y bengalí. Más adecuado para la comprensión de documentos, el análisis de gráficos/diagramas, tareas de OCR y respuesta visual a preguntas multilingüe. Limitaciones: las tareas de conteo y el razonamiento espacial de grano fino pueden verse afectadas por el enfoque de tiling. Para inferencia óptima, use precisión bfloat16 en GPUs con soporte CUDA. Se soporta inferencia MLX para Apple Silicon. Para recuperación basada en embeddings sobre documentos visuales, combínelo con jina-embeddings-v4 o jina-reranker-m0.

Blogs que mencionan este modelo
diciembre 04, 2025 • 7 minutos de lectura
Jina-VLM: Modelo de Lenguaje de Visión Multilingüe Pequeño
Nuevo modelo de lenguaje de visión de 2B logra SOTA en VQA multilingüe, sin olvido catastrófico en tareas de solo texto.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.