Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
模型與訓練
結果
入門指南
結語
star
甄選
新聞稿
九月 14, 2026

jina-ocr-v1:在低預算 GPU 上實現更快速的文件解析

jina-ocr-v1 是一項具備 3.4B 參數與 570M 活躍參數的視覺語言模型,在 OmniDocBench v1.6 上得分 91.1,在 olmOCR-Bench 上得分 83.4。
jina-ocr-v1
Jina AI
Jina AI • 9 分鐘閱讀
jina-ocr-v1 - 搜尋基礎模型
單次傳遞的頁面轉 Markdown 文件解析器,具備 5.7 億活動參數
搜尋基礎模型Jina AI
Jina-OCR-v1:透過推測解碼與密集可驗證獎勵實現高效文件解析
我們推出了 Jina-OCR-v1,這是一款專為低預算 GPU 設計的端到端文件解析模型。它結合了 DeepSeek-OCR 的壓縮視覺編碼器與 3B 混合專家(Mixture-of-Experts)解碼器,每個詞元(Tokens)啟動約 5.7 億參數,並搭配 FastMTP 推測解碼頭,能在 K=3 的預測步驟中遞迴共享單一草稿區塊。貪婪驗證確保了解碼的無損性。訓練後階段結合了指令對齊、針對困難文件的強健性微調,以及在密集可驗證獎勵下的 GRPO:透過確定性的公式、表格與結構檢查來給予部分獎勵。訓練資料混合了已清洗的公開語料庫與針對性的合成頁面。在預設的動態解析度設定下,Jina-OCR-v1 在 OmniDocBench v1.6 上得分 91.14,在 olmOCR-Bench 上得分 83.4,並在我們的比較中達到了每秒 2.57 頁的最高頁面處理量。在 NVIDIA L4 等低預算 GPU 上,FastMTP 的解碼速度較貪婪自迴歸解碼提升了一倍。該模型已在 https://huggingface.co/jinaai/jina-ocr-v1 公開。
arXiv.orgAlejandro Barón García

我們發布了 jina-ocr-v1,這是一款擁有 34 億參數的文件解析器,每個詞元(Tokens)具備約 5.7 億活動解碼器參數。它在 OmniDocBench v1.6 上獲得 91.14 分,在 olmOCR-Bench 上獲得 83.4 分,並且以 每秒 2.57 頁 的處理速度,成為我們所測試的 14 個系統中頁面處理量最高的模型。在 NVIDIA L4 上,其推測解碼頭將解碼速度提升了近一倍,同時保持了解碼的無損性。

該模型建立在 DeepSeek-OCR 的壓縮視覺編碼器與混合專家解碼器之上,並增加了兩項功能。FastMTP 草稿頭將一個區塊遞迴應用於三個預測步驟,因此草稿參數不會隨著深度增加。訓練後階段在密集可驗證獎勵下進行,其中每一項檢查都是針對參考資料進行的確定性程式碼比對,且每一項都會進行評分。在此基礎之上,訓練後階段在 olmOCR-Bench 上增加了 7.4 分,並提升了 OmniDocBench 的所有欄位表現。

Three-panel overview of specialized OCR models
決定部署成本的三個軸向。(a) 每個視覺詞元(Tokens)的像素數,對數尺度。DeepEncoder 將 1024x1024 的視野從 4,096 個圖塊映射到 256 個詞元,每個視覺詞元為 3,887 像素,而採用 28 到 32 像素圖塊的編碼器則為 783 到 1,022 像素。(b) 在單張 A100 上,併發數為 32 時的 olmOCR-Bench 頁面處理量。(c) 對應活動參數的基準測試總體表現,對數尺度,實線連接了帕累托最優(Pareto-optimal)系統。jina-ocr-v1 在 5.7 億活動參數下位於兩個前沿之上。
Serving efficiency of fourteen OCR systems ranked three ways
在單張 A100、併發數 32 的條件下,對 14 個 olmOCR-Bench 系統進行排名,排名方式為:(a) 每秒輸出詞元(Tokens)數,(b) 每頁輸出詞元(Tokens)數,以及 (c) 每秒頁面處理量(前兩者的比值)。Surya OCR 2 在每秒詞元數方面領先,達到 3,760,但每頁輸出 3,568 個詞元,每秒完成 1.05 頁。jina-ocr-v1 結合了每秒 2,792 個詞元與每頁 1,085 個詞元,達到了 2.57 頁/秒。

tag模型與訓練

長篇輸出是導致文件解析解碼成本高昂的原因。DeepSeek-OCR 透過壓縮視覺編碼器與緊湊的混合專家解碼器消除了大部分成本,而 jina-ocr-v1 繼承了這兩者,並針對剩餘的自迴歸瓶頸進行了最佳化。

Architecture of jina-ocr-v1
架構。DeepEncoder 和 MoE 解碼器遵循 DeepSeek-OCR,頁面產生 1024x1024 的全域視圖,包含 256 個視覺詞元,以及 n 個局部圖塊,每個圖塊包含 100 個詞元。橘色的 FastMTP 頭為解碼器提出了由一個共享草稿區塊產生的 K = 3 個詞元供驗證。

OCR 輸出接近確定性且具有局部結構,這使其成為推測解碼的理想工作負載。傳統架構會在每個預測深度附加一個草稿頭,因此草稿參數會隨著模型預測的長度而增加。FastMTP 使用一個單一的密集區塊進行 K = 3 步的遞迴應用。驗證器會貪婪地檢查每個提案,並接受草稿與驗證器達成共識的最長前綴,因此提交的序列等於驗證器的貪婪序列,而推測僅改變輸出所需的時間。

組件規格
視覺編碼器DeepEncoder (~3.8 億):SAM (8000 萬) → 16x conv → CLIP-L (3 億)
視覺詞元256 @ 1024x1024 (基礎);256+100n, n ≤ 9 (Gundam, ≤ 1,156/頁)
解碼器DeepSeek-3B-MoE:12 層,d = 1280,64 路由 + 2 共享,top-6
活動/總參數~5.7 億 / ~30 億 (解碼器);< 10 億 / ~34 億 (完整模型)
詞彙量129,280
位置限制32,768 (RoPE, θ = 106)
MTP 頭1 個共享密集區塊,遞迴 K = 3 步 (FastMTP)

模型規格。解碼器輸出 Markdown 格式,表格採用 HTML,公式採用 LaTeX。

訓練資料選自公開的 OCR 語料庫,包括 olmOCR-mix、FinePDFs、LightOnOCR、MMTab 和 UniMER,以及諸如 Europeana 報紙、國會圖書館謄本和 NARA 養老金檔案等刻意選擇的困難來源。基於規則的過濾器會刪除退化循環與重複內容,視覺語言傳遞階段則會重新標記這些困難來源。我們也基於特定原因合成頁面:在自然頁面上,公式與表格獎勵項適用的樣本非常少,因此大多數推論過程不帶有結構性訊號。JinaOCRSynth 在每頁中填入可評分的公式與表格,並隨附單元測試。

訓練後階段執行監督式對齊、針對退化頁面的強健性微調,以及 GRPO,並在外層迴圈的幾輪中重複進行。GRPO 獎勵是可驗證項目的乘積,每一項都由針對參考轉錄的確定性程式碼計算得出。

組件訊號角色
內容混合 LaTeX/HTML 的正規化編輯距離文字保真度
公式公式字串匹配公式準確性
表格TEDS, TEDS-S, 表格編輯距離結構恢復
結構有效性括號平衡、標籤閉合、表格完整性結構完整性
單元測試通過 olmOCR 風格的呈現、順序、數學與表格測試比例密集回饋
重複與格式重複懲罰、HTML 一致性退化控制

乘法獎勵組合。大多數項目都有下限,因為在乘法運算下,一項檢查失敗會導致本來正確的頁面失去梯度。重複項沒有下限,因為退化循環是最容易膨脹內容分數的失敗模式。

每一輪訓練會留下一個候選檢查點池。代理程式在固定的評估預算下搜尋合併配置,並利用單元測試與編輯距離檢查對其進行評分,所選合併中的錯誤將驅動下一輪的收集。草稿頭在最後階段,於迴圈所選的驗證器上進行擬合。

tag結果

模型參數ArXivOldScans-MathTablesOldScansMulti-colLongTinyHdr/FtrBaseOverall
Gemini 3 Flash–80.173.664.645.875.390.327.4––
Qwen3-VL-235B235B/22B88.481.286.749.685.988.933.6––
DeepSeek-OCR3B/570M77.574.577.333.167.383.096.199.376.0
dots.mocr3B85.985.590.748.285.381.694.099.783.9
olmOCR-28B82.982.184.348.384.381.4–99.782.4
LightOnOCR-21B89.685.689.042.284.891.419.799.683.2
chandra-ocr-24B86.989.192.151.182.193.791.499.985.8
jina-ocr-v13B/570M86.182.388.842.685.593.288.799.983.4

olmOCR-Bench 測試。jina-ocr-v1 的整體得分為 83.4,比其進行後訓練所依賴的 DeepSeek-OCR 骨幹模型高出 7.4 分,並領先於 8B 參數的 olmOCR-2。Hdr/Ftr(頁首/頁尾)欄位測試的是文字缺失情況,並獎勵忽略頁首與頁尾的行為,因此追求全頁忠實轉錄的模型在此項得分較低。

方法參數Overall ↑TextEdit ↓FormulaCDM ↑TableTEDS ↑TableTEDS-S ↑ROEdit ↓
Gemini 3 Flash–92.620.06695.1689.2993.510.172
Qwen3-VL-235B235B/22B89.780.06392.5583.0786.750.166
DeepSeek-OCR-23B/570M90.250.05091.8483.8987.750.144
HunyuanOCR-1.51B94.740.03994.5093.6794.710.129
PaddleOCR-VL-1.60.9B96.340.03397.5394.7697.100.128
jina-ocr-v13B/570M91.140.04693.2884.6889.010.142

OmniDocBench v1.6 測試。jina-ocr-v1 在 570M 活躍參數下達到 91.14 分,在每一項指標中均領先 DeepSeek-OCR-2,並超越了參數規模大得多的 Qwen3-VL-235B。

tag在 L4 GPU 上進行投機採樣(Speculative Decoding)

模式k輸出 詞元/秒 ↑加速比 S ↑接受率τc ↓
Eager042.71.00x––1.00
Eager164.01.50x82.6%1.831.22
Eager277.91.82x69.1%2.381.30
Eager383.11.95x57.6%2.731.40
Graph0158.31.00x––1.00
Graph1185.61.17x82.9%1.831.56
Graph2183.81.16x69.3%2.382.05
Graph3172.91.09x57.9%2.742.51

FastMTP 在 olmOCR-Bench、NVIDIA L4、vLLM 0.20.1、批次大小為 1 的環境下測試。τ 是每次投機步驟提交的平均詞元數(包含額外獎勵的詞元),c = τ/S 為單個投機步驟的成本(單位為單個自回歸步驟)。數據在與上述圖表不同的設備上測得。

草稿質量與執行模式無關,因為在 k = 3 時,Eager 模式下的 τ 為 2.73,CUDA Graph 模式下為 2.74。基準測試則有差異。CUDA Graphs 將自回歸解碼速度從每秒 42.7 個詞元提升至 158.3 個詞元,而投機步驟的開銷保持在 9 毫秒左右,因此其成本從 1.40 個自回歸步驟上升至 2.51 個。效能增益取決於其所替代的驗證步驟成本,這使得最佳深度在 Eager 模式下為 k = 3,而在 Graph 模式下為 k = 1。

tag入門指南

最快的運行方式是使用 Jina Reader。將 r.jina.ai 指向一個網址並添加一個標頭(Header):Reader 會抓取頁面或 PDF、進行渲染,並對結果執行 jina-ocr-v1,最後回傳 Markdown。無需部署,無需編寫圖像處理管道,並使用與平台其他服務相同的 API 金鑰。

curl "https://r.jina.ai/https://example.com/document.pdf" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -H "X-Respond-With: jina-ocr-v1"

添加 X-Page 參數可轉錄多頁文件中的單頁。這兩個參數均可在 Reader API 編輯器中找到,其中的切換開關會為您自動寫入標頭。

若要直接存取模型,託管端點與 OpenAI 相容,僅需從 jina.ai 獲取 API 金鑰即可使用。

curl https://api.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
    "model": "jina-ocr-v1",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Transcribe the provided document image into a clean Markdown format, preserving the natural reading order."},
        {"type": "image_url", "image_url": {"url": "https://example.com/document.png"}}
      ]
    }]
  }'

若要自行部署,權重和自定義建模代碼包含在一個 Hugging Face 儲存庫中,使用 trust_remote_code=True 即可載入。FastMTP 需要 vLLM 0.21 或更高版本,並在引擎啟動前進行一次架構註冊。

import sys
from huggingface_hub import snapshot_download
from PIL import Image
from vllm import LLM

sys.path.insert(0, snapshot_download('jinaai/jina-ocr-v1'))
from deepseek_ocr_mtp import DEFAULT_OCR_PROMPT, register, vllm_llm_kwargs, vllm_sampling_params

register()
llm = LLM(**vllm_llm_kwargs('jinaai/jina-ocr-v1',
                            num_speculative_tokens=3,
                            mtp_heads=1,
                            mtp_recursive=True))

image = Image.open('document.png').convert('RGB')
outputs = llm.chat(
    [{'role': 'user', 'content': [{'type': 'image_pil', 'image_pil': image},
                                  {'type': 'text', 'text': DEFAULT_OCR_PROMPT}]}],
    sampling_params=vllm_sampling_params(max_tokens=4096),
)
print(outputs[0].outputs[0].text)

一個細節決定了是否能實現加速:輔助工具使用 method="eagle" 註冊頭部,因為 FastMTP 是透過遞迴隱狀態回饋進行訓練的,而預設的 method="mtp" 會在每個草稿步驟中將目標重新定位。Transformers 路徑僅執行 MoE 解碼器,會忽略 MTP 權重。

該模型還支援對表格、公式、標題、文件視覺問答(VQA)和關鍵資訊提取進行元素級別的轉錄,支援英語和中文。權重依據 CC BY-NC 4.0 條款發佈。

tag結語

在 570M 活躍參數下,jina-ocr-v1 處於基準測試的準確度與參數效率前沿,並具有我們測量過的所有系統中最高的頁面處理吞吐量。兩個關鍵因素實現了這一點,且兩者都不需要更大的模型:對每個可驗證步驟的評分獎勵,以及針對最終驗證器訓練的草稿頭部。

輸出的長度值得進一步關注。詞元吞吐量和頁面吞吐量對系統的排名影響不同,且輸出長度與解析品質無關,因此簡潔性可以單獨優化。在所有得分高於 83 的系統中,jina-ocr-v1 的輸出長度最短。

類別:
star
甄選
新聞稿
rss_feed

閱讀更多
八月 03, 2026 • 11 分鐘閱讀
jina-reranker-v3.5:透過混合注意力機制與自我知識蒸餾實現更快速的列表式重排器
Jina AI
五月 12, 2026 • 7 分鐘閱讀
jina-embeddings-v5-omni:支援文字、圖片、音訊與影片的向量模型
Jina AI
二月 19, 2026 • 7 分鐘閱讀
jina-embeddings-v5-text:全新的 SOTA 小型多語言向量模型
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。