Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
資料錄入
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-ocr-v1

頁面轉 Markdown 的文件解析模型,570M 啟用參數
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2026-09-14
輸入
image
圖片
picture_as_pdf
PDF
arrow_forward
輸出
abc
文字
模型詳情
參數: 3.4B
輸入詞元長度: 32K
輸入影像尺寸: 1024×1024
底座模型 help_outline
open_in_new
DeepSeek-OCR
已訓練語言 help_outline
25 種語言
支援的語言 help_outline
108 種語言
相關模型
link
ReaderLM-v2
link
jina-vlm
可透過以下方式獲取
Jina API
Hugging Face
I/O 圖

圖片

jina-ocr-v1

PDF

Markdown

帕累託前緣help_outline
olmOCR-Bench
OmniDocBench v1.6
chevron_leftchevron_right
1B3.0B10B406080Qwen2-VL-7BQwen2.5-VL-7BDeepSeek-OCRdots.mocrolmOCR-2LightOnOCR-2chandra-ocr-2Nanonets-OCR2-3BInfinity-Parser-7BChandra-OCR-0.1.0GOT-OCRQwen2-VL-7BQwen2.5-VL-7BPaddleOCR-VLMinerU-2.5jina-ocr-v1參數量(對數)score
本模型
在前緣上
Jina AI
其他
olmOCR-Bench
83.40
參數量
3.4B
按分數的排名
3 / 16
帕累託前緣
在前緣之後
選擇要比較的模型
論文 (1)
arXiv
九月 02, 2026
jina-ocr-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

概述

jina-ocr-v1 一次通過就把頁面變成 Markdown:文字、公式、表格和閱讀順序一併給出。它的不同之處在於工程投入的方向。解析品質已經飽和,模型於是攻擊生產中真正花錢的部分——解碼。OCR 輸出局部可預測,模型因此提前起草 3 個詞元,讓驗證器以貪心方式檢查。由於驗證是貪心的,結果是無損的,與樸素自回歸解碼逐位元一致,模型每次驗證器通過最多確認 2.7 個詞元而非 1 個。

其餘都源於同一目標。它是總參數 3.4B 的專家混合模型,每個詞元僅約 570M 啟用,運行成本是小模型級別,容量卻不是。在預設動態解析度設定下,OmniDocBench v1.6 得分 91.14,olmOCR-Bench 得分 83.4。

語言覆蓋繼承自底座模型。DeepSeek-OCR 在覆蓋約 100 種語言的 3000 萬頁 PDF 上預訓練,jina-ocr-v1 保留了它的編碼器與解碼器,同樣的廣度適用於文件解析。

ReaderLM-v2 把已抽取的 HTML 轉成 Markdown。jina-ocr-v1 從更早一步開始,直接讀取渲染後的頁面。

方法

架構繼承了 DeepSeek-OCR 的 DeepEncoder 和專家混合解碼器。DeepEncoder 約 380M 參數,將 80M 的 SAM 階段接入 16 倍卷積壓縮器,再接 300M 的 CLIP-L 階段,因此 1024x1024 的一頁只需 256 個視覺詞元。Gundam 動態解析度模式每增加一個圖塊加 100 個詞元,單頁最多 1,156 個詞元。解碼器是 DeepSeek-3B-MoE:12 層、隱藏維度 1280、64 個路由專家加 2 個共享專家(top-6 路由)、詞彙 129,280、位置上限 32,768。

解碼速度來自 FastMTP:單個稠密草稿區塊遞迴用於 K=3 個預測步,而非 K 個獨立頭。驗證是貪心的,使投機路徑無損。輸出的文字與樸素自回歸解碼產生的完全相同。

後訓練包括指令對齊、針對困難與退化文件的穩健性微調,以及在稠密可驗證獎勵下的 GRPO——獎勵是確定性的公式、表格與結構檢查,給部分分而非單一的通過/不通過訊號。訓練資料把清理過的公開 OCR 語料(olmOCR-mix、FinePDFs、DoclingMatrix、SynthChartNet、UniMER)與 Europeana 報紙、國會圖書館轉錄稿、NARA 養老金檔案等歷史與退化資料,以及承載 olmOCR-Bench 風格單元測試的定向合成頁面混在一起,讓獎勵在關鍵處有覆蓋。

效能

olmOCR-Bench 上模型總體得分 83.4。按子集看,Base 99.9,與對比組中最好者並列,其後是 LongTiny 93.2、Tables 88.8、Hdr/Ftr 88.7、ArXiv 86.1、Multi-column 85.5、OldScans-Math 82.3、OldScans 42.6。OmniDocBench v1.6 上總體 91.14,文字編輯距離 0.046、公式 CDM 93.28、表格 TEDS 84.68、TEDS-S 89.01、閱讀順序編輯距離 0.142。

效率結果才是這個模型的要點。在一塊 A100 SXM4 40GB、並行度 32、1,403 頁的條件下測得 2.57 頁/秒,為對比組最高,約為 olmOCR-2 的 1.22 的兩倍,同時每頁輸出 1,085 個詞元、每秒 2,792 個詞元。得分更高的模型要慢得多:chandra-ocr-2 在品質上以 85.8 領先,但只有 0.38 頁/秒;dots.mocr 以 0.55 頁/秒得 83.9。詞元數字有競爭力,但不是池中最好:PaddleOCR-VL-1.6 每頁更省(1,048),Surya OCR 2 每秒輸出更多(3,760)。

投機解碼讓低成本 GPU 變得可行。在 NVIDIA L4、批大小 1 上,FastMTP 在 K=3 時把 eager 模式解碼從 42.7 提升到 83.1 輸出詞元/秒,接受率 57.6%,提速 1.95 倍。用 CUDA 圖時基線已有 158.3 詞元/秒,K=1 是最佳工作點,185.6,提升 1.17 倍。這些 L4 資料在不同硬體上以批大小 1 測得,與上面的 A100 吞吐量數字不可比。

最佳實踐

通用文件請使用預設動態解析度設定,這也是所報成績使用的配置。輸出是 Markdown,表格和公式已結構化,無需單獨的後處理步驟。模型面向低預算 GPU。L4 或同級別即可互動式解析單一文件;投機解碼在 eager 模式下收益最大,請在該模式下啟用 K=3,使用 CUDA 圖時啟用 K=1。由於驗證是貪心的,開關投機解碼只改變吞吐量,不改變文字。

最適合大量文件攝取、PDF 轉 Markdown 流水線、掃描與歷史檔案,以及任何「每美元每秒頁數」比基準分最後 1 分更重要的負載。頁首頁尾會被轉錄而非丟棄,這對檔案保真是期望行為,但在文字缺失測試中得分偏低。OldScans 仍是最弱子集(42.6),重度退化的掃描件仍值得人工檢查。

如果輸入是已抓取好的 HTML,達到同樣 Markdown 目標,ReaderLM-v2 是更便宜的工具。若要對頁面做視覺問答而非轉錄,用 jina-vlm。對解析結果做檢索,搭配 jina-embeddings-v4。

提及此模型的部落格
九月 14, 2026 • 9 分鐘閱讀
jina-ocr-v1:在低預算 GPU 上實現更快速的文件解析
jina-ocr-v1 是一項具備 3.4B 參數與 570M 活躍參數的視覺語言模型,在 OmniDocBench v1.6 上得分 91.1,在 olmOCR-Bench 上得分 83.4。
Jina AI
jina-ocr-v1
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。