Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
数据录入
copyright CC BY-NC 4.0
open_in_new 发布博客

jina-ocr-v1

页面转 Markdown 的文档解析模型,570M 激活参数
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2026-09-14
输入
image
图片
picture_as_pdf
PDF
arrow_forward
输出
abc
文本
模型详情
参数: 3.4B
输入词元长度: 32K
输入图像尺寸: 1024×1024
底座模型 help_outline
open_in_new
DeepSeek-OCR
已训练语言 help_outline
25 种语言
支持的语言 help_outline
108 种语言
相关模型
link
ReaderLM-v2
link
jina-vlm
可通过以下方式获取
Jina API
Hugging Face
I/O 图

图片

jina-ocr-v1

PDF

Markdown

帕累托前沿help_outline
olmOCR-Bench
OmniDocBench v1.6
chevron_leftchevron_right
1B3.0B10B406080Qwen2-VL-7BQwen2.5-VL-7BDeepSeek-OCRdots.mocrolmOCR-2LightOnOCR-2chandra-ocr-2Nanonets-OCR2-3BInfinity-Parser-7BChandra-OCR-0.1.0GOT-OCRQwen2-VL-7BQwen2.5-VL-7BPaddleOCR-VLMinerU-2.5jina-ocr-v1参数量(对数)score
本模型
在前沿上
Jina AI
其他
olmOCR-Bench
83.40
参数量
3.4B
按分数的排名
3 / 16
帕累托前沿
在前沿之后
选择要比较的模型
论文 (1)
arXiv
九月 02, 2026
jina-ocr-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

概述

jina-ocr-v1 一次通过就把页面变成 Markdown:文本、公式、表格和阅读顺序一并给出。它的不同之处在于工程投入的方向。解析质量已趋饱和,模型于是攻击生产中真正花钱的部分——解码。OCR 输出局部可预测,模型因此提前起草 3 个词元,让验证器以贪心方式检查。由于验证是贪心的,结果是无损的,与朴素自回归解码逐字节一致,模型每次验证器通过最多确认 2.7 个词元而非 1 个。

其余都源于同一目标。它是总参数 3.4B 的专家混合模型,每个词元仅约 570M 激活,运行成本是小模型级别,容量却不是。在默认动态分辨率设置下,OmniDocBench v1.6 得分 91.14,olmOCR-Bench 得分 83.4。

语言覆盖继承自底座模型。DeepSeek-OCR 在覆盖约 100 种语言的 3000 万页 PDF 上预训练,jina-ocr-v1 保留了它的编码器和解码器,同样的广度适用于文档解析。

ReaderLM-v2 把已抽取的 HTML 转成 Markdown。jina-ocr-v1 从更早一步开始,直接读取渲染后的页面。

方法

架构继承了 DeepSeek-OCR 的 DeepEncoder 和专家混合解码器。DeepEncoder 约 380M 参数,将 80M 的 SAM 阶段接入 16 倍卷积压缩器,再接 300M 的 CLIP-L 阶段,因此 1024x1024 的一页只需 256 个视觉词元。Gundam 动态分辨率模式每增加一个图块加 100 个词元,单页最多 1,156 个词元。解码器是 DeepSeek-3B-MoE:12 层、隐藏维度 1280、64 个路由专家加 2 个共享专家(top-6 路由)、词表 129,280、位置上限 32,768。

解码速度来自 FastMTP:单个稠密草稿块递归用于 K=3 个预测步,而非 K 个独立头。验证是贪心的,使投机路径无损。输出的文本与朴素自回归解码产生的完全相同。

后训练包括指令对齐、针对困难与退化文档的鲁棒性微调,以及在稠密可验证奖励下的 GRPO——奖励是确定性的公式、表格与结构检查,给部分分而非单一的通过/不通过信号。训练数据把清理过的公开 OCR 语料(olmOCR-mix、FinePDFs、DoclingMatrix、SynthChartNet、UniMER)与 Europeana 报纸、国会图书馆转录稿、NARA 养老金档案等历史与退化资料,以及承载 olmOCR-Bench 风格单元测试的定向合成页面混在一起,让奖励在关键处有覆盖。

性能

olmOCR-Bench 上模型总体得分 83.4。按子集看,Base 99.9,与对比组中最好者并列,其后是 LongTiny 93.2、Tables 88.8、Hdr/Ftr 88.7、ArXiv 86.1、Multi-column 85.5、OldScans-Math 82.3、OldScans 42.6。OmniDocBench v1.6 上总体 91.14,文本编辑距离 0.046、公式 CDM 93.28、表格 TEDS 84.68、TEDS-S 89.01、阅读顺序编辑距离 0.142。

效率结果才是这个模型的要点。在一块 A100 SXM4 40GB、并发度 32、1,403 页的条件下测得 2.57 页/秒,为对比组最高,约为 olmOCR-2 的 1.22 的两倍,同时每页输出 1,085 个词元、每秒 2,792 个词元。得分更高的模型要慢得多:chandra-ocr-2 在质量上以 85.8 领先,但只有 0.38 页/秒;dots.mocr 以 0.55 页/秒得 83.9。词元数字有竞争力,但不是池中最好:PaddleOCR-VL-1.6 每页更省(1,048),Surya OCR 2 每秒输出更多(3,760)。

投机解码让低成本 GPU 变得可行。在 NVIDIA L4、批大小 1 上,FastMTP 在 K=3 时把 eager 模式解码从 42.7 提升到 83.1 输出词元/秒,接受率 57.6%,提速 1.95 倍。用 CUDA 图时基线已有 158.3 词元/秒,K=1 是最佳工作点,185.6,提升 1.17 倍。这些 L4 数据在不同硬件上以批大小 1 测得,与上面的 A100 吞吐数字不可比。

最佳实践

通用文档请使用默认动态分辨率设置,这也是所报成绩使用的配置。输出是 Markdown,表格和公式已结构化,无需单独的后处理步骤。模型面向低预算 GPU。L4 或同级别即可交互式解析单个文档;投机解码在 eager 模式下收益最大,请在该模式下启用 K=3,使用 CUDA 图时启用 K=1。由于验证是贪心的,开关投机解码只改变吞吐,不改变文本。

最适合批量文档摄取、PDF 转 Markdown 流水线、扫描与历史档案,以及任何「每美元每秒页数」比基准分的最后 1 分更重要的负载。页眉页脚会被转录而非丢弃,这对档案保真是期望行为,但在文本缺失测试中得分偏低。OldScans 仍是最弱子集(42.6),重度退化的扫描件仍值得人工检查。

如果输入是已抓取好的 HTML,达到同样 Markdown 目标,ReaderLM-v2 是更便宜的工具。若要对页面做视觉问答而非转录,用 jina-vlm。对解析结果做检索,搭配 jina-embeddings-v4。

提及此模型的博客
九月 14, 2026 • 9 分钟阅读
jina-ocr-v1:在低成本 GPU 上实现更快的文档解析
jina-ocr-v1 是一款拥有 34 亿参数和 5.7 亿激活参数的视觉语言模型,在 OmniDocBench v1.6 上得分为 91.1,在 olmOCR-Bench 上得分为 83.4。
Jina AI
jina-ocr-v1
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 标志
open_in_new
下载 Elastic 标志
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业使用,不面向消费者。