概述
jina-ocr-v1 一次通過就把頁面變成 Markdown:文字、公式、表格和閱讀順序一併給出。它的不同之處在於工程投入的方向。解析品質已經飽和,模型於是攻擊生產中真正花錢的部分——解碼。OCR 輸出局部可預測,模型因此提前起草 3 個詞元,讓驗證器以貪心方式檢查。由於驗證是貪心的,結果是無損的,與樸素自回歸解碼逐位元一致,模型每次驗證器通過最多確認 2.7 個詞元而非 1 個。
其餘都源於同一目標。它是總參數 3.4B 的專家混合模型,每個詞元僅約 570M 啟用,運行成本是小模型級別,容量卻不是。在預設動態解析度設定下,OmniDocBench v1.6 得分 91.14,olmOCR-Bench 得分 83.4。
語言覆蓋繼承自底座模型。DeepSeek-OCR 在覆蓋約 100 種語言的 3000 萬頁 PDF 上預訓練,jina-ocr-v1 保留了它的編碼器與解碼器,同樣的廣度適用於文件解析。
ReaderLM-v2 把已抽取的 HTML 轉成 Markdown。jina-ocr-v1 從更早一步開始,直接讀取渲染後的頁面。
方法
架構繼承了 DeepSeek-OCR 的 DeepEncoder 和專家混合解碼器。DeepEncoder 約 380M 參數,將 80M 的 SAM 階段接入 16 倍卷積壓縮器,再接 300M 的 CLIP-L 階段,因此 1024x1024 的一頁只需 256 個視覺詞元。Gundam 動態解析度模式每增加一個圖塊加 100 個詞元,單頁最多 1,156 個詞元。解碼器是 DeepSeek-3B-MoE:12 層、隱藏維度 1280、64 個路由專家加 2 個共享專家(top-6 路由)、詞彙 129,280、位置上限 32,768。
解碼速度來自 FastMTP:單個稠密草稿區塊遞迴用於 K=3 個預測步,而非 K 個獨立頭。驗證是貪心的,使投機路徑無損。輸出的文字與樸素自回歸解碼產生的完全相同。
後訓練包括指令對齊、針對困難與退化文件的穩健性微調,以及在稠密可驗證獎勵下的 GRPO——獎勵是確定性的公式、表格與結構檢查,給部分分而非單一的通過/不通過訊號。訓練資料把清理過的公開 OCR 語料(olmOCR-mix、FinePDFs、DoclingMatrix、SynthChartNet、UniMER)與 Europeana 報紙、國會圖書館轉錄稿、NARA 養老金檔案等歷史與退化資料,以及承載 olmOCR-Bench 風格單元測試的定向合成頁面混在一起,讓獎勵在關鍵處有覆蓋。
效能
olmOCR-Bench 上模型總體得分 83.4。按子集看,Base 99.9,與對比組中最好者並列,其後是 LongTiny 93.2、Tables 88.8、Hdr/Ftr 88.7、ArXiv 86.1、Multi-column 85.5、OldScans-Math 82.3、OldScans 42.6。OmniDocBench v1.6 上總體 91.14,文字編輯距離 0.046、公式 CDM 93.28、表格 TEDS 84.68、TEDS-S 89.01、閱讀順序編輯距離 0.142。
效率結果才是這個模型的要點。在一塊 A100 SXM4 40GB、並行度 32、1,403 頁的條件下測得 2.57 頁/秒,為對比組最高,約為 olmOCR-2 的 1.22 的兩倍,同時每頁輸出 1,085 個詞元、每秒 2,792 個詞元。得分更高的模型要慢得多:chandra-ocr-2 在品質上以 85.8 領先,但只有 0.38 頁/秒;dots.mocr 以 0.55 頁/秒得 83.9。詞元數字有競爭力,但不是池中最好:PaddleOCR-VL-1.6 每頁更省(1,048),Surya OCR 2 每秒輸出更多(3,760)。
投機解碼讓低成本 GPU 變得可行。在 NVIDIA L4、批大小 1 上,FastMTP 在 K=3 時把 eager 模式解碼從 42.7 提升到 83.1 輸出詞元/秒,接受率 57.6%,提速 1.95 倍。用 CUDA 圖時基線已有 158.3 詞元/秒,K=1 是最佳工作點,185.6,提升 1.17 倍。這些 L4 資料在不同硬體上以批大小 1 測得,與上面的 A100 吞吐量數字不可比。
最佳實踐
通用文件請使用預設動態解析度設定,這也是所報成績使用的配置。輸出是 Markdown,表格和公式已結構化,無需單獨的後處理步驟。模型面向低預算 GPU。L4 或同級別即可互動式解析單一文件;投機解碼在 eager 模式下收益最大,請在該模式下啟用 K=3,使用 CUDA 圖時啟用 K=1。由於驗證是貪心的,開關投機解碼只改變吞吐量,不改變文字。
最適合大量文件攝取、PDF 轉 Markdown 流水線、掃描與歷史檔案,以及任何「每美元每秒頁數」比基準分最後 1 分更重要的負載。頁首頁尾會被轉錄而非丟棄,這對檔案保真是期望行為,但在文字缺失測試中得分偏低。OldScans 仍是最弱子集(42.6),重度退化的掃描件仍值得人工檢查。
如果輸入是已抓取好的 HTML,達到同樣 Markdown 目標,ReaderLM-v2 是更便宜的工具。若要對頁面做視覺問答而非轉錄,用 jina-vlm。對解析結果做檢索,搭配 jina-embeddings-v4。


