概述
jina-ocr-v1 一次通过就把页面变成 Markdown:文本、公式、表格和阅读顺序一并给出。它的不同之处在于工程投入的方向。解析质量已趋饱和,模型于是攻击生产中真正花钱的部分——解码。OCR 输出局部可预测,模型因此提前起草 3 个词元,让验证器以贪心方式检查。由于验证是贪心的,结果是无损的,与朴素自回归解码逐字节一致,模型每次验证器通过最多确认 2.7 个词元而非 1 个。
其余都源于同一目标。它是总参数 3.4B 的专家混合模型,每个词元仅约 570M 激活,运行成本是小模型级别,容量却不是。在默认动态分辨率设置下,OmniDocBench v1.6 得分 91.14,olmOCR-Bench 得分 83.4。
语言覆盖继承自底座模型。DeepSeek-OCR 在覆盖约 100 种语言的 3000 万页 PDF 上预训练,jina-ocr-v1 保留了它的编码器和解码器,同样的广度适用于文档解析。
ReaderLM-v2 把已抽取的 HTML 转成 Markdown。jina-ocr-v1 从更早一步开始,直接读取渲染后的页面。
方法
架构继承了 DeepSeek-OCR 的 DeepEncoder 和专家混合解码器。DeepEncoder 约 380M 参数,将 80M 的 SAM 阶段接入 16 倍卷积压缩器,再接 300M 的 CLIP-L 阶段,因此 1024x1024 的一页只需 256 个视觉词元。Gundam 动态分辨率模式每增加一个图块加 100 个词元,单页最多 1,156 个词元。解码器是 DeepSeek-3B-MoE:12 层、隐藏维度 1280、64 个路由专家加 2 个共享专家(top-6 路由)、词表 129,280、位置上限 32,768。
解码速度来自 FastMTP:单个稠密草稿块递归用于 K=3 个预测步,而非 K 个独立头。验证是贪心的,使投机路径无损。输出的文本与朴素自回归解码产生的完全相同。
后训练包括指令对齐、针对困难与退化文档的鲁棒性微调,以及在稠密可验证奖励下的 GRPO——奖励是确定性的公式、表格与结构检查,给部分分而非单一的通过/不通过信号。训练数据把清理过的公开 OCR 语料(olmOCR-mix、FinePDFs、DoclingMatrix、SynthChartNet、UniMER)与 Europeana 报纸、国会图书馆转录稿、NARA 养老金档案等历史与退化资料,以及承载 olmOCR-Bench 风格单元测试的定向合成页面混在一起,让奖励在关键处有覆盖。
性能
olmOCR-Bench 上模型总体得分 83.4。按子集看,Base 99.9,与对比组中最好者并列,其后是 LongTiny 93.2、Tables 88.8、Hdr/Ftr 88.7、ArXiv 86.1、Multi-column 85.5、OldScans-Math 82.3、OldScans 42.6。OmniDocBench v1.6 上总体 91.14,文本编辑距离 0.046、公式 CDM 93.28、表格 TEDS 84.68、TEDS-S 89.01、阅读顺序编辑距离 0.142。
效率结果才是这个模型的要点。在一块 A100 SXM4 40GB、并发度 32、1,403 页的条件下测得 2.57 页/秒,为对比组最高,约为 olmOCR-2 的 1.22 的两倍,同时每页输出 1,085 个词元、每秒 2,792 个词元。得分更高的模型要慢得多:chandra-ocr-2 在质量上以 85.8 领先,但只有 0.38 页/秒;dots.mocr 以 0.55 页/秒得 83.9。词元数字有竞争力,但不是池中最好:PaddleOCR-VL-1.6 每页更省(1,048),Surya OCR 2 每秒输出更多(3,760)。
投机解码让低成本 GPU 变得可行。在 NVIDIA L4、批大小 1 上,FastMTP 在 K=3 时把 eager 模式解码从 42.7 提升到 83.1 输出词元/秒,接受率 57.6%,提速 1.95 倍。用 CUDA 图时基线已有 158.3 词元/秒,K=1 是最佳工作点,185.6,提升 1.17 倍。这些 L4 数据在不同硬件上以批大小 1 测得,与上面的 A100 吞吐数字不可比。
最佳实践
通用文档请使用默认动态分辨率设置,这也是所报成绩使用的配置。输出是 Markdown,表格和公式已结构化,无需单独的后处理步骤。模型面向低预算 GPU。L4 或同级别即可交互式解析单个文档;投机解码在 eager 模式下收益最大,请在该模式下启用 K=3,使用 CUDA 图时启用 K=1。由于验证是贪心的,开关投机解码只改变吞吐,不改变文本。
最适合批量文档摄取、PDF 转 Markdown 流水线、扫描与历史档案,以及任何「每美元每秒页数」比基准分的最后 1 分更重要的负载。页眉页脚会被转录而非丢弃,这对档案保真是期望行为,但在文本缺失测试中得分偏低。OldScans 仍是最弱子集(42.6),重度退化的扫描件仍值得人工检查。
如果输入是已抓取好的 HTML,达到同样 Markdown 目标,ReaderLM-v2 是更便宜的工具。若要对页面做视觉问答而非转录,用 jina-vlm。对解析结果做检索,搭配 jina-embeddings-v4。


