Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Modelo y entrenamiento
Resultados
Cómo empezar
Conclusión
star
Presentado
Comunicado de prensa
septiembre 14, 2026

jina-ocr-v1: Análisis de documentos más rápido en GPU de bajo presupuesto

jina-ocr-v1 es un modelo de lenguaje visual con 3.4 mil millones de parámetros y 570 millones de parámetros activos, que obtiene una puntuación de 91.1 en OmniDocBench v1.6 y 83.4 en olmOCR-Bench.
jina-ocr-v1
Jina AI
Jina AI • 9 minutos de lectura
jina-ocr-v1 - Search Foundation Models
Analizador de documentos para pasar de página a Markdown en una sola pasada con 570 millones de parámetros activos
Search Foundation ModelsJina AI
Jina-OCR-v1: Análisis eficiente de documentos con decodificación especulativa y recompensas verificables densas
Presentamos Jina-OCR-v1, un modelo de análisis de documentos de extremo a extremo diseñado para ejecutarse en GPU de bajo presupuesto. Combina el codificador de visión comprimida y el decodificador de mezcla de expertos de 3B de DeepSeek-OCR, que activa alrededor de 570 millones de parámetros por cada 词元, con un cabezal de decodificación especulativa FastMTP que comparte un único bloque de borrador de forma recursiva a lo largo de K=3 pasos de predicción. La verificación codiciosa hace que la decodificación no tenga pérdidas. El post-entrenamiento combina la alineación de instrucciones, el ajuste de robustez en documentos difíciles y GRPO bajo recompensas verificables densas: fórmulas deterministas, tablas y comprobaciones estructurales que otorgan crédito parcial. Los datos de entrenamiento mezclan corpus públicos limpios con páginas sintéticas específicas. En la configuración predeterminada de resolución dinámica, Jina-OCR-v1 obtiene una puntuación de 91.14 en OmniDocBench v1.6 y 83.4 en olmOCR-Bench, y alcanza el mayor rendimiento de páginas en nuestra comparación con 2.57 páginas por segundo. En una GPU de bajo presupuesto como la NVIDIA L4, FastMTP duplica la velocidad de decodificación en comparación con la decodificación autorregresiva codiciosa. El modelo está disponible públicamente en https://huggingface.co/jinaai/jina-ocr-v1.
arXiv.orgAlejandro Barón García

Lanzamos jina-ocr-v1, un analizador de documentos de 3.4 mil millones de parámetros con alrededor de 570 millones de parámetros de decodificador activos por cada 词元. Obtiene una puntuación de 91.14 en OmniDocBench v1.6 y 83.4 en olmOCR-Bench, y con 2.57 páginas por segundo posee el mayor rendimiento de páginas de los catorce sistemas que medimos. En una NVIDIA L4, su cabezal de decodificación especulativa casi duplica la velocidad de decodificación mientras mantiene la decodificación sin pérdidas.

El modelo se basa en el codificador de visión comprimida y el decodificador de mezcla de expertos de DeepSeek-OCR y añade dos cosas. Un cabezal de borrador FastMTP aplica un bloque de forma recursiva para tres pasos de predicción, por lo que los parámetros del borrador no crecen con la profundidad. El post-entrenamiento se ejecuta bajo recompensas verificables densas, donde cada comprobación es código determinista frente a una referencia y cada comprobación se califica. Frente a esa estructura, el post-entrenamiento añade 7.4 puntos en olmOCR-Bench y mejora cada columna de OmniDocBench.

Tres paneles de resumen de modelos de OCR especializados
Tres ejes que determinan el coste de despliegue. (a) Píxeles por 词元 visual, escala logarítmica. DeepEncoder asigna una vista de 1024x1024 de 4,096 parches a 256 词元, lo que da 3,887 píxeles por 词元 visual frente a 783 a 1,022 para codificadores con parches de 28 a 32 px. (b) Rendimiento de páginas en olmOCR-Bench, una A100, concurrencia 32. (c) Evaluación comparativa general frente a parámetros activos, escala logarítmica, con la línea sólida uniendo los sistemas óptimos de Pareto. jina-ocr-v1 se encuentra en ambas fronteras con 570 millones de parámetros activos.
Eficiencia de servicio de catorce sistemas OCR clasificados de tres formas
Los mismos catorce sistemas en olmOCR-Bench, una A100 a concurrencia 32, clasificados por (a) 词元 de salida por segundo, (b) 词元 de salida por página, y (c) páginas por segundo, que es la relación de los dos primeros. Surya OCR 2 lidera en 词元 por segundo con 3,760 pero emite 3,568 词元 por página y completa 1.05 páginas por segundo. jina-ocr-v1 combina 2,792 词元 por segundo con 1,085 词元 por página y alcanza 2.57.

tagModelo y entrenamiento

Las salidas largas son las que hacen que el análisis de documentos sea costoso de decodificar. DeepSeek-OCR eliminó la mayor parte de ese coste con un codificador de visión comprimido y un decodificador compacto de mezcla de expertos, y jina-ocr-v1 hereda ambos y se dirige al cuello de botella autorregresivo que permanece.

Arquitectura de jina-ocr-v1
Arquitectura. DeepEncoder y el decodificador MoE siguen a DeepSeek-OCR, y una página genera una vista global de 1024x1024 de 256 词元 visuales más n mosaicos locales de 100 词元 cada uno. El cabezal FastMTP, en naranja, propone K = 3 词元 de un bloque de borrador compartido para que el decodificador los verifique.

La salida de OCR es casi determinista y está estructurada localmente, lo que la convierte en una carga de trabajo favorable para la decodificación especulativa. La construcción habitual conecta un cabezal de borrador por profundidad de predicción, por lo que los parámetros del borrador crecen según qué tan lejos mire el modelo. FastMTP utiliza un único bloque denso aplicado recursivamente para pasos de K = 3. El verificador comprueba cada propuesta de forma codiciosa y acepta el prefijo más largo en el que el borrador y el verificador coinciden, por lo que la secuencia comprometida es igual a la secuencia codiciosa del verificador y la especulación solo cambia cuánto tarda la salida.

ComponenteEspecificación
Codificador de visiónDeepEncoder (~380M): SAM (80M) → 16x conv → CLIP-L (300M)
词元 visuales256 @ 1024x1024 (Base); 256+100n, n ≤ 9 (Gundam, ≤ 1,156/página)
DecodificadorDeepSeek-3B-MoE: 12 capas, d = 1280, 64 enrutados + 2 compartidos, top-6
Parámetros activos / totales~570M / ~3B (decodificador); < 1B / ~3.4B (modelo completo)
Vocabulario129,280
Límite de posición32,768 (RoPE, θ = 106)
Cabezal MTP1 bloque denso compartido, pasos recursivos K = 3 (FastMTP)

Especificación del modelo. El decodificador emite Markdown, con tablas en HTML y fórmulas en LaTeX.

Los datos de entrenamiento provienen de corpus de OCR públicos que incluyen olmOCR-mix, FinePDFs, LightOnOCR, MMTab y UniMER, además de fuentes deliberadamente difíciles como periódicos de Europeana, transcripciones de la Biblioteca del Congreso y archivos de pensiones de la NARA. Un filtro basado en reglas elimina bucles de degeneración y duplicados, y una pasada de lenguaje visual vuelve a etiquetar las fuentes difíciles. También sintetizamos páginas por una razón específica: en las páginas naturales, los términos de recompensa de fórmulas y tablas se aplican a muy pocas muestras, por lo que la mayoría de los despliegues no conllevan ninguna señal estructural. JinaOCRSynth llena cada página con fórmulas y tablas puntuables y las envía con pruebas unitarias.

El post-entrenamiento ejecuta una alineación supervisada, un ajuste de robustez en páginas degradadas y GRPO, repetido a lo largo de las rondas de un bucle exterior. La recompensa GRPO es un producto de términos verificables, cada uno calculado mediante código determinista frente a una transcripción de referencia.

ComponenteSeñalRol
ContenidoDistancia de edición normalizada en LaTeX/HTML mixtoFidelidad textual
FórmulaCoincidencia de cadenas de fórmulasCorrección de fórmulas
TablaTEDS, TEDS-S, distancia de edición de tablaRecuperación de estructura
Validez estructuralEquilibrio de llaves, cierre de etiquetas, integridad de tablasFormación correcta
Pruebas unitariasFracción de pruebas aprobadas de presencia, orden, matemáticas y tablas estilo olmOCRRetroalimentación densa
Repetición y formatoPenalización por repetición, conformidad HTMLControl de degeneración

Composición de recompensa multiplicativa. La mayoría de los términos tienen un mínimo, ya que bajo un producto, una comprobación fallida eliminaría el gradiente de una página por lo demás correcta. El término de repetición no tiene ninguno, porque los bucles degenerados son el modo de fallo que infla más fácilmente la puntuación de contenido.

Cada ronda deja un conjunto de puntos de control candidatos. Un agente busca configuraciones de combinación bajo un presupuesto de evaluación fijo y las califica con comprobaciones de pruebas unitarias y distancia de edición, y los errores en la combinación seleccionada impulsan la siguiente ronda de recolección. El cabezal de borrador se ajusta al final, sobre el verificador que selecciona el bucle.

tagResultados

ModeloParámetrosArXivOldScans-MathTablasOldScansMulti-colLongTinyHdr/FtrBaseGeneral
Gemini 3 Flash–80.173.664.645.875.390.327.4––
Qwen3-VL-235B235B/22B88.481.286.749.685.988.933.6––
DeepSeek-OCR3B/570M77.574.577.333.167.383.096.199.376.0
dots.mocr3B85.985.590.748.285.381.694.099.783.9
olmOCR-28B82.982.184.348.384.381.4–99.782.4
LightOnOCR-21B89.685.689.042.284.891.419.799.683.2
chandra-ocr-24B86.989.192.151.182.193.791.499.985.8
jina-ocr-v13B/570M86.182.388.842.685.593.288.799.983.4

olmOCR-Bench. jina-ocr-v1 alcanza 83.4 en el puntaje general, 7.4 puntos por encima del modelo base DeepSeek-OCR con el que fue post-entrenado y supera al modelo olmOCR-2 de 8B. La columna Hdr/Ftr evalúa la ausencia de texto y premia la omisión de encabezados y pies de página, por lo que la transcripción fiel de página completa obtiene puntuaciones bajas en esa categoría.

MétodoParámetrosGeneral ↑TextoEdición ↓FórmulaCDM ↑TablaTEDS ↑TablaTEDS-S ↑ROEdición ↓
Gemini 3 Flash–92.620.06695.1689.2993.510.172
Qwen3-VL-235B235B/22B89.780.06392.5583.0786.750.166
DeepSeek-OCR-23B/570M90.250.05091.8483.8987.750.144
HunyuanOCR-1.51B94.740.03994.5093.6794.710.129
PaddleOCR-VL-1.60.9B96.340.03397.5394.7697.100.128
jina-ocr-v13B/570M91.140.04693.2884.6889.010.142

OmniDocBench v1.6. jina-ocr-v1 alcanza 91.14 con 570M de parámetros activos, superando a DeepSeek-OCR-2 en todas las columnas y por encima del modelo mucho más grande Qwen3-VL-235B.

tagDecodificación especulativa en una L4

ModokSalida tok/s ↑Aceleración S ↑Tasa de aceptaciónτc ↓
Eager042.71.00x––1.00
Eager164.01.50x82.6%1.831.22
Eager277.91.82x69.1%2.381.30
Eager383.11.95x57.6%2.731.40
Graph0158.31.00x––1.00
Graph1185.61.17x82.9%1.831.56
Graph2183.81.16x69.3%2.382.05
Graph3172.91.09x57.9%2.742.51

FastMTP en olmOCR-Bench, NVIDIA L4, vLLM 0.20.1, tamaño de lote 1. τ es el número medio de词元 (tokens) confirmados por paso especulativo incluyendo el 词元 (token) de bonificación, y c = τ/S es el costo de un paso especulativo en unidades de un paso autorregresivo. Medido en un dispositivo distinto a las cifras anteriores.

La calidad del borrador no depende del modo de ejecución, ya que τ es 2.73 en modo eager y 2.74 bajo grafos CUDA en k = 3. La línea base sí depende. Los grafos CUDA aumentan la decodificación autorregresiva de 42.7 a 158.3 词元 (tokens) por segundo, mientras que la sobrecarga de un paso especulativo se mantiene cerca de los 9 ms, por lo que su costo aumenta de 1.40 a 2.51 pasos autorregresivos. La ganancia sigue el costo del paso de verificación que reemplaza, lo que sitúa la profundidad óptima en k = 3 en modo eager y k = 1 bajo grafos.

tagCómo empezar

La forma más rápida de ejecutarlo es con Jina Reader. Apunte r.jina.ai a una URL y añada un encabezado: Reader recupera la página o PDF, lo renderiza, ejecuta jina-ocr-v1 sobre el resultado y devuelve Markdown. No hay nada que implementar, no hay que escribir tuberías de imágenes y utiliza la misma clave de API que el resto de la plataforma.

curl "https://r.jina.ai/https://example.com/document.pdf" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -H "X-Respond-With: jina-ocr-v1"

Añada X-Page para transcribir una página de un documento de varias páginas. Ambos parámetros están en el editor de la API de Reader, donde el interruptor escribe el encabezado por usted.

Para el acceso directo al modelo, el endpoint alojado es compatible con OpenAI y solo necesita una clave de API de jina.ai.

curl https://api.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
    "model": "jina-ocr-v1",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Transcribe the provided document image into a clean Markdown format, preserving the natural reading order."},
        {"type": "image_url", "image_url": {"url": "https://example.com/document.png"}}
      ]
    }]
  }'

Para servirlo usted mismo, los pesos y el código de modelado personalizado se suministran en un repositorio de Hugging Face cargado con trust_remote_code=True. FastMTP necesita vLLM 0.21 o posterior y un registro de arquitectura único antes de que se inicie el motor.

import sys
from huggingface_hub import snapshot_download
from PIL import Image
from vllm import LLM

sys.path.insert(0, snapshot_download('jinaai/jina-ocr-v1'))
from deepseek_ocr_mtp import DEFAULT_OCR_PROMPT, register, vllm_llm_kwargs, vllm_sampling_params

register()
llm = LLM(**vllm_llm_kwargs('jinaai/jina-ocr-v1',
                            num_speculative_tokens=3,
                            mtp_heads=1,
                            mtp_recursive=True))

image = Image.open('document.png').convert('RGB')
outputs = llm.chat(
    [{'role': 'user', 'content': [{'type': 'image_pil', 'image_pil': image},
                                  {'type': 'text', 'text': DEFAULT_OCR_PROMPT}]}],
    sampling_params=vllm_sampling_params(max_tokens=4096),
)
print(outputs[0].outputs[0].text)

Un detalle determina si aparece la aceleración. El asistente registra la cabecera con method="eagle", ya que FastMTP está entrenado con retroalimentación de estado oculto recursivo y el method="mtp" predeterminado vuelve a basar cada paso del borrador en el objetivo. La ruta de Transformers ejecuta el decodificador MoE solo e ignora los pesos MTP.

El modelo también maneja la transcripción a nivel de elemento de tablas y fórmulas, subtítulos, VQA de documentos y extracción de información clave, en inglés y chino. Los pesos se publican bajo CC BY-NC 4.0.

tagConclusión

Con 570M de parámetros activos, jina-ocr-v1 se sitúa en la frontera de precisión por parámetro de ambos benchmarks y tiene el mayor rendimiento de páginas de los sistemas que medimos. Dos palancas hacen ese trabajo y ninguna necesita un modelo más grande: una recompensa graduada en cada verificación comprobable y una cabecera de borrador entrenada contra el verificador final.

Vale la pena analizar más de cerca la longitud de la salida. El rendimiento de 词元 (tokens) y el rendimiento de páginas clasifican los sistemas de forma diferente, y la longitud de la salida es independiente de la calidad del análisis, por lo que la concisión puede optimizarse por sí sola. jina-ocr-v1 tiene las salidas más cortas de cualquier sistema con una puntuación superior a 83.

Categorías:
star
Presentado
Comunicado de prensa
rss_feed

Leer más
agosto 03, 2026 • 11 minutos de lectura
jina-reranker-v3.5: Reclasificación listwise más rápida con atención híbrida y auto-destilación
Jina AI
mayo 12, 2026 • 7 minutos de lectura
jina-embeddings-v5-omni: Modelos de vectores para texto, imagen, audio y vídeo
Jina AI
febrero 19, 2026 • 7 minutos de lectura
jina-embeddings-v5-text: Nuevos Embeddings Multilingües Pequeños SOTA
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.