Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Модель и обучение
Результаты
Начало работы
Заключение
star
Избранное
Пресс-релиз
сентябрь 14, 2026

jina-ocr-v1: более быстрый разбор документов на недорогих GPU

jina-ocr-v1 — это мультимодальная языковая модель с 3,4 млрд параметров и 570 млн активных параметров, набравшая 91,1 балла в OmniDocBench v1.6 и 83,4 балла в olmOCR-Bench.
jina-ocr-v1
Jina AI
Jina AI • 9 минуты чтения
jina-ocr-v1 — Фундаментальные модели для поиска
Парсер документов в Markdown за один проход с 570 млн активных параметров
Search Foundation ModelsJina AI
Jina-OCR-v1: Эффективный парсинг документов с помощью спекулятивного декодирования и плотных верифицируемых вознаграждений
Мы представляем Jina-OCR-v1, сквозную модель для парсинга документов, разработанную для работы на бюджетных GPU. Она объединяет кодировщик сжатого зрения и декодер mixture-of-experts на 3 млрд параметров от DeepSeek-OCR, который активирует около 570 млн параметров на каждый 词元 (token), с головкой спекулятивного декодирования FastMTP, которая рекурсивно использует единый черновой блок на K=3 шагах предсказания. Жадная верификация делает декодирование без потерь. Посттренировка сочетает в себе выравнивание по инструкциям, тонкую настройку устойчивости на сложных документах и алгоритм GRPO с использованием плотных верифицируемых вознаграждений: детерминированных проверок формул, таблиц и структуры, которые позволяют получать частичные баллы. Обучающие данные смешивают очищенные общедоступные корпуса с целевыми синтетическими страницами. При стандартных настройках динамического разрешения Jina-OCR-v1 набирает 91,14 балла на OmniDocBench v1.6 и 83,4 на olmOCR-Bench, достигая самой высокой пропускной способности среди протестированных нами систем — 2,57 страницы в секунду. На бюджетном GPU, таком как NVIDIA L4, FastMTP удваивает скорость декодирования по сравнению с жадным авторегрессионным декодированием. Модель доступна публично по адресу https://huggingface.co/jinaai/jina-ocr-v1.
arXiv.orgAlejandro Barón García

Мы выпускаем jina-ocr-v1, парсер документов с 3,4 млрд параметров и примерно 570 млн активных параметров декодера на каждый 词元 (token). Модель набирает 91,14 балла в OmniDocBench v1.6 и 83,4 в olmOCR-Bench, а ее пропускная способность составляет 2,57 страницы в секунду — это самый высокий показатель среди четырнадцати протестированных нами систем. На NVIDIA L4 ее головка спекулятивного декодирования почти удваивает скорость декодирования, сохраняя при этом процесс декодирования без потерь.

Модель основана на кодировщике сжатого зрения и декодере mixture-of-experts из DeepSeek-OCR, к которым мы добавили две вещи. Головка FastMTP применяет один блок рекурсивно для трех шагов предсказания, поэтому параметры «черновика» не растут с увеличением глубины. Посттренировка проходит с использованием плотных верифицируемых вознаграждений, где каждая проверка представляет собой детерминированный код, сверяемый с эталоном, и каждая проверка оценивается. На этой основе посттренировка добавляет 7,4 балла в olmOCR-Bench и улучшает показатели по всем столбцам OmniDocBench.

Обзор специализированных моделей OCR в трех панелях
Три оси, определяющие стоимость развертывания. (a) Пикселей на визуальный 词元 (token), логарифмический масштаб. DeepEncoder отображает представление 1024x1024 из 4096 патчей в 256 词元 (token)ов, что дает 3887 пикселей на визуальный 词元 (token) против 783–1022 для кодировщиков с патчами 28–32 пкс. (b) Пропускная способность страниц на olmOCR-Bench, один A100, параллелизм 32. (c) Общая оценка бенчмарка относительно активных параметров, логарифмический масштаб, сплошная линия соединяет системы, оптимальные по Парето. jina-ocr-v1 находится на обеих границах при 570 млн активных параметров.
Эффективность обслуживания 14 систем OCR, ранжированных тремя способами
Те же четырнадцать систем на olmOCR-Bench, один A100 при параллелизме 32, ранжированные по: (a) выходным 词元 (token)ам в секунду, (b) выходным 词元 (token)ам на страницу и (c) страницам в секунду, что является отношением первых двух показателей. Surya OCR 2 лидирует по 词元 (token)ам в секунду с результатом 3760, но генерирует 3568 词元 (token)ов на страницу и выполняет 1,05 страницы в секунду. jina-ocr-v1 объединяет 2792 词元 (token)а в секунду с 1085 词元 (token)ами на страницу, достигая показателя 2,57.

tagМодель и обучение

Длинные выходные данные делают парсинг документов дорогостоящим процессом декодирования. DeepSeek-OCR устранила большую часть этих затрат с помощью кодировщика сжатого зрения и компактного декодера mixture-of-experts, а jina-ocr-v1 наследует оба решения и нацеливается на остающееся узкое место авторегрессии.

Архитектура jina-ocr-v1
Архитектура. DeepEncoder и декодер MoE соответствуют DeepSeek-OCR, страница дает глобальное представление 1024x1024 из 256 визуальных 词元 (token)ов плюс n локальных фрагментов по 100 词元 (token)ов каждый. Головка FastMTP (выделена оранжевым) предлагает K = 3 词元 (token)а из одного общего чернового блока для проверки декодером.

Выходные данные OCR почти детерминированы и локально структурированы, что делает их благоприятной нагрузкой для спекулятивного декодирования. Обычно используется конструкция с одной черновой головкой на каждую глубину предсказания, поэтому параметры черновика растут вместе с тем, насколько далеко модель заглядывает вперед. FastMTP использует единственный плотный блок, применяемый рекурсивно для K = 3 шагов. Верификатор жадно проверяет каждое предложение и принимает самый длинный префикс, в котором черновик и верификатор согласны, поэтому зафиксированная последовательность равна жадной последовательности верификатора, а спекуляция лишь ускоряет получение вывода.

КомпонентСпецификация
Кодировщик зренияDeepEncoder (~380M): SAM (80M) → 16x conv → CLIP-L (300M)
Визуальные 词元 (token)ы256 @ 1024x1024 (Base); 256+100n, n ≤ 9 (Gundam, ≤ 1156/стр.)
ДекодерDeepSeek-3B-MoE: 12 слоев, d = 1280, 64 маршрутизируемых + 2 общих, top-6
Активные / всего параметров~570M / ~3B (декодер); < 1B / ~3.4B (вся модель)
Словарь129 280
Лимит позиции32 768 (RoPE, θ = 106)
Головка MTP1 общий плотный блок, рекурсивные K = 3 шага (FastMTP)

Спецификация модели. Декодер выдает Markdown, таблицы в формате HTML, формулы в LaTeX.

Обучающие данные взяты из публичных корпусов OCR, включая olmOCR-mix, FinePDFs, LightOnOCR, MMTab и UniMER, плюс намеренно сложные источники, такие как газеты Europeana, транскрипты Библиотеки Конгресса и пенсионные архивы NARA. Фильтр на основе правил удаляет вырожденные циклы и дубликаты, а проход через модель зрения-языка переразмечает сложные источники. Мы также синтезируем страницы по конкретной причине: на естественных страницах штрафы за формулы и таблицы применяются к очень немногим образцам, поэтому большинство прогонов не несут структурного сигнала. JinaOCRSynth наполняет каждую страницу оцениваемыми формулами и таблицами и включает модульные тесты.

Посттренировка включает контролируемое выравнивание, тонкую настройку устойчивости на деградированных страницах и GRPO, повторяемые в циклах внешнего контура. Вознаграждение GRPO — это произведение верифицируемых условий, каждое из которых вычисляется детерминированным кодом относительно эталонной транскрипции.

КомпонентСигналРоль
КонтентНормализованное расстояние редактирования для смеси LaTeX/HTMLТекстовая точность
ФормулаСопоставление строк формулПравильность формул
ТаблицаTEDS, TEDS-S, расстояние редактирования таблицыВосстановление структуры
Структурная валидностьБаланс скобок, закрытие тегов, целостность таблицКорректность формата
Модульные тестыДоля пройденных тестов на присутствие, порядок, математику и таблицыПлотная обратная связь
Повторы и форматШтраф за повторы, соответствие HTMLКонтроль дегенерации

Мультипликативная композиция вознаграждений. Большинство условий имеют нижний порог, так как при произведении одна неудачная проверка может убрать градиент от страницы, которая в остальном верна. У условия повторов порога нет, поскольку вырожденные циклы — это тип ошибки, который легче всего завышает оценку контента.

Каждый раунд оставляет пул кандидатных контрольных точек. Агент ищет конфигурации слияния при фиксированном бюджете оценки и ранжирует их с помощью модульных тестов и проверок расстояния редактирования, а ошибки в выбранном слиянии определяют следующий раунд сбора данных. Головка черновика подбирается в последнюю очередь, на той версии верификатора, которую выбрал цикл.

tagРезультаты

МодельПараметрыArXivOldScans-MathTablesOldScansMulti-colLongTinyHdr/FtrBaseOverall
Gemini 3 Flash–80.173.664.645.875.390.327.4––
Qwen3-VL-235B235B/22B88.481.286.749.685.988.933.6––
DeepSeek-OCR3B/570M77.574.577.333.167.383.096.199.376.0
dots.mocr3B85.985.590.748.285.381.694.099.783.9
olmOCR-28B82.982.184.348.384.381.4–99.782.4
LightOnOCR-21B89.685.689.042.284.891.419.799.683.2
chandra-ocr-24B86.989.192.151.182.193.791.499.985.8
jina-ocr-v13B/570M86.182.388.842.685.593.288.799.983.4

olmOCR-Bench. Модель jina-ocr-v1 достигает общего показателя 83,4, что на 7,4 пункта выше, чем у базовой модели DeepSeek-OCR, на основе которой она была дообучена, и опережает olmOCR-2 с 8 млрд параметров. Столбец Hdr/Ftr проверяет отсутствие текста и поощряет исключение верхних и нижних колонтитулов, поэтому качественная постраничная транскрипция получает здесь низкие оценки.

МетодПараметрыOverall ↑TextEdit ↓FormulaCDM ↑TableTEDS ↑TableTEDS-S ↑ROEdit ↓
Gemini 3 Flash–92.620.06695.1689.2993.510.172
Qwen3-VL-235B235B/22B89.780.06392.5583.0786.750.166
DeepSeek-OCR-23B/570M90.250.05091.8483.8987.750.144
HunyuanOCR-1.51B94.740.03994.5093.6794.710.129
PaddleOCR-VL-1.60.9B96.340.03397.5394.7697.100.128
jina-ocr-v13B/570M91.140.04693.2884.6889.010.142

OmniDocBench v1.6. Модель jina-ocr-v1 достигает 91,14 при 570 млн активных параметров, опережая DeepSeek-OCR-2 по всем столбцам и обходя гораздо более крупную Qwen3-VL-235B.

tagСпекулятивная декодировка на L4

РежимkВывод 词元/с ↑Ускорение S ↑Коэффициент принятияτc ↓
Eager042.71.00x––1.00
Eager164.01.50x82.6%1.831.22
Eager277.91.82x69.1%2.381.30
Eager383.11.95x57.6%2.731.40
Graph0158.31.00x––1.00
Graph1185.61.17x82.9%1.831.56
Graph2183.81.16x69.3%2.382.05
Graph3172.91.09x57.9%2.742.51

FastMTP на olmOCR-Bench, NVIDIA L4, vLLM 0.20.1, размер пакета 1. τ — это среднее количество 词元, зафиксированных на один спекулятивный шаг, включая бонусный 词元, а c = τ/S — стоимость одного спекулятивного шага в единицах одного авторегрессионного шага. Измерения проводились на другом устройстве, отличном от указанного на графиках выше.

Качество черновика не зависит от режима выполнения, так как τ составляет 2,73 в режиме eager и 2,74 при использовании графов CUDA при k = 3. Базовый показатель меняется. Графы CUDA повышают скорость авторегрессионного декодирования с 42,7 до 158,3 词元 в секунду, в то время как накладные расходы на спекулятивный шаг остаются в районе 9 мс, поэтому его стоимость возрастает с 1,40 до 2,51 авторегрессионного шага. Прирост коррелирует со стоимостью шага верификатора, который он заменяет, что делает оптимальной глубину k = 3 в режиме eager и k = 1 при использовании графов.

tagНачало работы

Самый быстрый способ запустить её — использовать Jina Reader. Укажите r.jina.ai в качестве адреса URL и добавьте один заголовок: Reader загрузит страницу или PDF, отрендерит их, запустит jina-ocr-v1 поверх результата и вернет Markdown. Ничего не нужно развертывать, писать сложную логику обработки изображений, используется тот же API-ключ, что и для остальной платформы.

curl "https://r.jina.ai/https://example.com/document.pdf" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -H "X-Respond-With: jina-ocr-v1"

Добавьте X-Page для транскрипции одной страницы многостраничного документа. Оба параметра доступны в редакторе Reader API, где переключатель автоматически создаст для вас заголовок.

Для прямого доступа к модели используется хостируемая конечная точка, совместимая с OpenAI, для которой нужен только API-ключ от jina.ai.

curl https://api.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
    "model": "jina-ocr-v1",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Transcribe the provided document image into a clean Markdown format, preserving the natural reading order."},
        {"type": "image_url", "image_url": {"url": "https://example.com/document.png"}}
      ]
    }]
  }'

Чтобы запустить модель самостоятельно, веса и код пользовательской модели поставляются в одном репозитории Hugging Face, который загружается с параметром trust_remote_code=True. Для FastMTP требуется vLLM 0.21 или новее и однократная регистрация архитектуры перед запуском движка.

import sys
from huggingface_hub import snapshot_download
from PIL import Image
from vllm import LLM

sys.path.insert(0, snapshot_download('jinaai/jina-ocr-v1'))
from deepseek_ocr_mtp import DEFAULT_OCR_PROMPT, register, vllm_llm_kwargs, vllm_sampling_params

register()
llm = LLM(**vllm_llm_kwargs('jinaai/jina-ocr-v1',
                            num_speculative_tokens=3,
                            mtp_heads=1,
                            mtp_recursive=True))

image = Image.open('document.png').convert('RGB')
outputs = llm.chat(
    [{'role': 'user', 'content': [{'type': 'image_pil', 'image_pil': image},
                                  {'type': 'text', 'text': DEFAULT_OCR_PROMPT}]}],
    sampling_params=vllm_sampling_params(max_tokens=4096),
)
print(outputs[0].outputs[0].text)

Одна деталь определяет, будет ли заметно ускорение. Вспомогательная функция регистрирует «голову» (head) с помощью method="eagle", поскольку FastMTP обучается с рекурсивной обратной связью по скрытому состоянию, а метод по умолчанию method="mtp" перепроверяет каждый черновой шаг на целевой модели. Путь через Transformers запускает только декодер MoE и игнорирует веса MTP.

Модель также поддерживает транскрипцию таблиц и формул на уровне элементов, описание изображений, ответы на вопросы по документам (VQA) и извлечение ключевой информации на английском и китайском языках. Веса выпущены по лицензии CC BY-NC 4.0.

tagЗаключение

При 570 млн активных параметров jina-ocr-v1 находится на границе эффективности «точность на параметр» для обоих бенчмарков и обладает самой высокой пропускной способностью страниц среди протестированных нами систем. Этого позволяют добиться два рычага, и ни один из них не требует более крупной модели: оценка с градированным вознаграждением при каждой верифицируемой проверке и черновая «голова», обученная по конечному верификатору.

Длину вывода стоит рассмотреть подробнее. Пропускная способность в 词元 и пропускная способность страниц ранжируют системы по-разному, а длина вывода не зависит от качества синтаксического анализа, поэтому лаконичность можно оптимизировать отдельно. Модель jina-ocr-v1 выдает самые короткие результаты среди всех систем с оценкой выше 83.

Категории:
star
Избранное
Пресс-релиз
rss_feed

Читать далее
август 03, 2026 • 11 минуты чтения
jina-reranker-v3.5: Более быстрая попарная переранжировка (listwise reranking) с использованием гибридного внимания (hybrid attention) и самодистилляции
Jina AI
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Векторные модели для текста, изображений, аудио и видео
Jina AI
февраль 19, 2026 • 7 минуты чтения
jina-embeddings-v5-text: новые SOTA компактные мультиязычные векторные модели
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.