

我們發布了 jina-ocr-v1,這是一款擁有 34 億參數的文件解析器,每個詞元(Tokens)具備約 5.7 億活動解碼器參數。它在 OmniDocBench v1.6 上獲得 91.14 分,在 olmOCR-Bench 上獲得 83.4 分,並且以 每秒 2.57 頁 的處理速度,成為我們所測試的 14 個系統中頁面處理量最高的模型。在 NVIDIA L4 上,其推測解碼頭將解碼速度提升了近一倍,同時保持了解碼的無損性。
該模型建立在 DeepSeek-OCR 的壓縮視覺編碼器與混合專家解碼器之上,並增加了兩項功能。FastMTP 草稿頭將一個區塊遞迴應用於三個預測步驟,因此草稿參數不會隨著深度增加。訓練後階段在密集可驗證獎勵下進行,其中每一項檢查都是針對參考資料進行的確定性程式碼比對,且每一項都會進行評分。在此基礎之上,訓練後階段在 olmOCR-Bench 上增加了 7.4 分,並提升了 OmniDocBench 的所有欄位表現。


tag模型與訓練
長篇輸出是導致文件解析解碼成本高昂的原因。DeepSeek-OCR 透過壓縮視覺編碼器與緊湊的混合專家解碼器消除了大部分成本,而 jina-ocr-v1 繼承了這兩者,並針對剩餘的自迴歸瓶頸進行了最佳化。

OCR 輸出接近確定性且具有局部結構,這使其成為推測解碼的理想工作負載。傳統架構會在每個預測深度附加一個草稿頭,因此草稿參數會隨著模型預測的長度而增加。FastMTP 使用一個單一的密集區塊進行 K = 3 步的遞迴應用。驗證器會貪婪地檢查每個提案,並接受草稿與驗證器達成共識的最長前綴,因此提交的序列等於驗證器的貪婪序列,而推測僅改變輸出所需的時間。
| 組件 | 規格 |
|---|---|
| 視覺編碼器 | DeepEncoder (~3.8 億):SAM (8000 萬) → 16x conv → CLIP-L (3 億) |
| 視覺詞元 | 256 @ 1024x1024 (基礎);256+100n, n ≤ 9 (Gundam, ≤ 1,156/頁) |
| 解碼器 | DeepSeek-3B-MoE:12 層,d = 1280,64 路由 + 2 共享,top-6 |
| 活動/總參數 | ~5.7 億 / ~30 億 (解碼器);< 10 億 / ~34 億 (完整模型) |
| 詞彙量 | 129,280 |
| 位置限制 | 32,768 (RoPE, θ = 106) |
| MTP 頭 | 1 個共享密集區塊,遞迴 K = 3 步 (FastMTP) |
模型規格。解碼器輸出 Markdown 格式,表格採用 HTML,公式採用 LaTeX。
訓練資料選自公開的 OCR 語料庫,包括 olmOCR-mix、FinePDFs、LightOnOCR、MMTab 和 UniMER,以及諸如 Europeana 報紙、國會圖書館謄本和 NARA 養老金檔案等刻意選擇的困難來源。基於規則的過濾器會刪除退化循環與重複內容,視覺語言傳遞階段則會重新標記這些困難來源。我們也基於特定原因合成頁面:在自然頁面上,公式與表格獎勵項適用的樣本非常少,因此大多數推論過程不帶有結構性訊號。JinaOCRSynth 在每頁中填入可評分的公式與表格,並隨附單元測試。
訓練後階段執行監督式對齊、針對退化頁面的強健性微調,以及 GRPO,並在外層迴圈的幾輪中重複進行。GRPO 獎勵是可驗證項目的乘積,每一項都由針對參考轉錄的確定性程式碼計算得出。
| 組件 | 訊號 | 角色 |
|---|---|---|
| 內容 | 混合 LaTeX/HTML 的正規化編輯距離 | 文字保真度 |
| 公式 | 公式字串匹配 | 公式準確性 |
| 表格 | TEDS, TEDS-S, 表格編輯距離 | 結構恢復 |
| 結構有效性 | 括號平衡、標籤閉合、表格完整性 | 結構完整性 |
| 單元測試 | 通過 olmOCR 風格的呈現、順序、數學與表格測試比例 | 密集回饋 |
| 重複與格式 | 重複懲罰、HTML 一致性 | 退化控制 |
乘法獎勵組合。大多數項目都有下限,因為在乘法運算下,一項檢查失敗會導致本來正確的頁面失去梯度。重複項沒有下限,因為退化循環是最容易膨脹內容分數的失敗模式。
每一輪訓練會留下一個候選檢查點池。代理程式在固定的評估預算下搜尋合併配置,並利用單元測試與編輯距離檢查對其進行評分,所選合併中的錯誤將驅動下一輪的收集。草稿頭在最後階段,於迴圈所選的驗證器上進行擬合。
tag結果
| 模型 | 參數 | ArXiv | OldScans-Math | Tables | OldScans | Multi-col | LongTiny | Hdr/Ftr | Base | Overall |
|---|---|---|---|---|---|---|---|---|---|---|
| Gemini 3 Flash | – | 80.1 | 73.6 | 64.6 | 45.8 | 75.3 | 90.3 | 27.4 | – | – |
| Qwen3-VL-235B | 235B/22B | 88.4 | 81.2 | 86.7 | 49.6 | 85.9 | 88.9 | 33.6 | – | – |
| DeepSeek-OCR | 3B/570M | 77.5 | 74.5 | 77.3 | 33.1 | 67.3 | 83.0 | 96.1 | 99.3 | 76.0 |
| dots.mocr | 3B | 85.9 | 85.5 | 90.7 | 48.2 | 85.3 | 81.6 | 94.0 | 99.7 | 83.9 |
| olmOCR-2 | 8B | 82.9 | 82.1 | 84.3 | 48.3 | 84.3 | 81.4 | – | 99.7 | 82.4 |
| LightOnOCR-2 | 1B | 89.6 | 85.6 | 89.0 | 42.2 | 84.8 | 91.4 | 19.7 | 99.6 | 83.2 |
| chandra-ocr-2 | 4B | 86.9 | 89.1 | 92.1 | 51.1 | 82.1 | 93.7 | 91.4 | 99.9 | 85.8 |
| jina-ocr-v1 | 3B/570M | 86.1 | 82.3 | 88.8 | 42.6 | 85.5 | 93.2 | 88.7 | 99.9 | 83.4 |
olmOCR-Bench 測試。jina-ocr-v1 的整體得分為 83.4,比其進行後訓練所依賴的 DeepSeek-OCR 骨幹模型高出 7.4 分,並領先於 8B 參數的 olmOCR-2。Hdr/Ftr(頁首/頁尾)欄位測試的是文字缺失情況,並獎勵忽略頁首與頁尾的行為,因此追求全頁忠實轉錄的模型在此項得分較低。
| 方法 | 參數 | Overall ↑ | TextEdit ↓ | FormulaCDM ↑ | TableTEDS ↑ | TableTEDS-S ↑ | ROEdit ↓ |
|---|---|---|---|---|---|---|---|
| Gemini 3 Flash | – | 92.62 | 0.066 | 95.16 | 89.29 | 93.51 | 0.172 |
| Qwen3-VL-235B | 235B/22B | 89.78 | 0.063 | 92.55 | 83.07 | 86.75 | 0.166 |
| DeepSeek-OCR-2 | 3B/570M | 90.25 | 0.050 | 91.84 | 83.89 | 87.75 | 0.144 |
| HunyuanOCR-1.5 | 1B | 94.74 | 0.039 | 94.50 | 93.67 | 94.71 | 0.129 |
| PaddleOCR-VL-1.6 | 0.9B | 96.34 | 0.033 | 97.53 | 94.76 | 97.10 | 0.128 |
| jina-ocr-v1 | 3B/570M | 91.14 | 0.046 | 93.28 | 84.68 | 89.01 | 0.142 |
OmniDocBench v1.6 測試。jina-ocr-v1 在 570M 活躍參數下達到 91.14 分,在每一項指標中均領先 DeepSeek-OCR-2,並超越了參數規模大得多的 Qwen3-VL-235B。
tag在 L4 GPU 上進行投機採樣(Speculative Decoding)
| 模式 | k | 輸出 詞元/秒 ↑ | 加速比 S ↑ | 接受率 | τ | c ↓ |
|---|---|---|---|---|---|---|
| Eager | 0 | 42.7 | 1.00x | – | – | 1.00 |
| Eager | 1 | 64.0 | 1.50x | 82.6% | 1.83 | 1.22 |
| Eager | 2 | 77.9 | 1.82x | 69.1% | 2.38 | 1.30 |
| Eager | 3 | 83.1 | 1.95x | 57.6% | 2.73 | 1.40 |
| Graph | 0 | 158.3 | 1.00x | – | – | 1.00 |
| Graph | 1 | 185.6 | 1.17x | 82.9% | 1.83 | 1.56 |
| Graph | 2 | 183.8 | 1.16x | 69.3% | 2.38 | 2.05 |
| Graph | 3 | 172.9 | 1.09x | 57.9% | 2.74 | 2.51 |
FastMTP 在 olmOCR-Bench、NVIDIA L4、vLLM 0.20.1、批次大小為 1 的環境下測試。τ 是每次投機步驟提交的平均詞元數(包含額外獎勵的詞元),c = τ/S 為單個投機步驟的成本(單位為單個自回歸步驟)。數據在與上述圖表不同的設備上測得。
草稿質量與執行模式無關,因為在 k = 3 時,Eager 模式下的 τ 為 2.73,CUDA Graph 模式下為 2.74。基準測試則有差異。CUDA Graphs 將自回歸解碼速度從每秒 42.7 個詞元提升至 158.3 個詞元,而投機步驟的開銷保持在 9 毫秒左右,因此其成本從 1.40 個自回歸步驟上升至 2.51 個。效能增益取決於其所替代的驗證步驟成本,這使得最佳深度在 Eager 模式下為 k = 3,而在 Graph 模式下為 k = 1。
tag入門指南
最快的運行方式是使用 Jina Reader。將 r.jina.ai 指向一個網址並添加一個標頭(Header):Reader 會抓取頁面或 PDF、進行渲染,並對結果執行 jina-ocr-v1,最後回傳 Markdown。無需部署,無需編寫圖像處理管道,並使用與平台其他服務相同的 API 金鑰。
curl "https://r.jina.ai/https://example.com/document.pdf" \
-H "Authorization: Bearer $JINA_API_KEY" \
-H "X-Respond-With: jina-ocr-v1"添加 X-Page 參數可轉錄多頁文件中的單頁。這兩個參數均可在 Reader API 編輯器中找到,其中的切換開關會為您自動寫入標頭。
若要直接存取模型,託管端點與 OpenAI 相容,僅需從 jina.ai 獲取 API 金鑰即可使用。
curl https://api.jina.ai/v1/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-ocr-v1",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "Transcribe the provided document image into a clean Markdown format, preserving the natural reading order."},
{"type": "image_url", "image_url": {"url": "https://example.com/document.png"}}
]
}]
}'
若要自行部署,權重和自定義建模代碼包含在一個 Hugging Face 儲存庫中,使用 trust_remote_code=True 即可載入。FastMTP 需要 vLLM 0.21 或更高版本,並在引擎啟動前進行一次架構註冊。
import sys
from huggingface_hub import snapshot_download
from PIL import Image
from vllm import LLM
sys.path.insert(0, snapshot_download('jinaai/jina-ocr-v1'))
from deepseek_ocr_mtp import DEFAULT_OCR_PROMPT, register, vllm_llm_kwargs, vllm_sampling_params
register()
llm = LLM(**vllm_llm_kwargs('jinaai/jina-ocr-v1',
num_speculative_tokens=3,
mtp_heads=1,
mtp_recursive=True))
image = Image.open('document.png').convert('RGB')
outputs = llm.chat(
[{'role': 'user', 'content': [{'type': 'image_pil', 'image_pil': image},
{'type': 'text', 'text': DEFAULT_OCR_PROMPT}]}],
sampling_params=vllm_sampling_params(max_tokens=4096),
)
print(outputs[0].outputs[0].text)
一個細節決定了是否能實現加速:輔助工具使用 method="eagle" 註冊頭部,因為 FastMTP 是透過遞迴隱狀態回饋進行訓練的,而預設的 method="mtp" 會在每個草稿步驟中將目標重新定位。Transformers 路徑僅執行 MoE 解碼器,會忽略 MTP 權重。
該模型還支援對表格、公式、標題、文件視覺問答(VQA)和關鍵資訊提取進行元素級別的轉錄,支援英語和中文。權重依據 CC BY-NC 4.0 條款發佈。
tag結語
在 570M 活躍參數下,jina-ocr-v1 處於基準測試的準確度與參數效率前沿,並具有我們測量過的所有系統中最高的頁面處理吞吐量。兩個關鍵因素實現了這一點,且兩者都不需要更大的模型:對每個可驗證步驟的評分獎勵,以及針對最終驗證器訓練的草稿頭部。
輸出的長度值得進一步關注。詞元吞吐量和頁面吞吐量對系統的排名影響不同,且輸出長度與解析品質無關,因此簡潔性可以單獨優化。在所有得分高於 83 的系統中,jina-ocr-v1 的輸出長度最短。






