Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
モデルとトレーニング
結果
はじめに
結論
star
注目
プレスリリース
9月 14, 2026

jina-ocr-v1:低予算GPUで高速な文書解析を実現

jina-ocr-v1 は、34億のパラメータ数と5億7000万の有効パラメータ数を持つビジョン言語モデルであり、OmniDocBench v1.6 で 91.1、olmOCR-Bench で 83.4 のスコアを記録しています。
jina-ocr-v1
Jina AI
Jina AI • 9 読む時間
jina-ocr-v1 - Search Foundation Models
Page-to-Markdown document parser in one pass at 570M active parameters
Search Foundation ModelsJina AI
Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards
We present Jina-OCR-v1, an end-to-end document parsing model built to serve on low-budget GPUs. It combines the compressed-vision encoder and the 3B mixture-of-experts decoder of DeepSeek-OCR, which activates about 570M parameters per token, with a FastMTP speculative decoding head that shares a single draft block recursively across K=3 prediction steps. Greedy verification makes decoding lossless. Post-training combines instruction alignment, robustness fine-tuning on difficult documents, and GRPO under dense verifiable rewards: deterministic formula, table, and structural checks that award partial credit. The training data mixes cleaned public corpora with targeted synthetic pages. At the default dynamic-resolution setting, Jina-OCR-v1 scores 91.14 on OmniDocBench v1.6 and 83.4 on olmOCR-Bench, and reaches the highest page throughput in our comparison at 2.57 pages per second. On a low-budget GPU such as the NVIDIA L4, FastMTP doubles decoding speed over greedy autoregressive decoding. The model is publicly available at https://huggingface.co/jinaai/jina-ocr-v1.
arXiv.orgAlejandro Barón García

私たちは、570M のアクティブなデコーダーパラメータ(トークンあたり)を持つ、3.4B パラメータのドキュメントパーサーである jina-ocr-v1 をリリースします。本モデルは OmniDocBench v1.6 で 91.14、olmOCR-Bench で 83.4 というスコアを記録し、測定した 14 のシステムの中で最も高い 毎秒 2.57 ページ というページ処理スループットを達成しました。NVIDIA L4 上では、その推論(スペキュレーティブ)デコーディングヘッドにより、デコーディングの損失なしにデコーディング速度をほぼ 2 倍に向上させます。

このモデルは DeepSeek-OCR の圧縮ビジョンエンコーダーと Mixture-of-Experts(MoE)デコーダーをベースに、2 つの要素を追加しています。FastMTP ドラフトヘッドは 1 つのブロックを 3 つの予測ステップにわたって再帰的に適用するため、ドラフトパラメータは深さが増しても増加しません。ポストトレーニングは高密度で検証可能な報酬の下で行われ、すべてのチェックはリファレンスに対する決定論的なコードであり、各チェックが評価されます。このバックボーンにより、ポストトレーニングによって olmOCR-Bench で 7.4 ポイントの向上が見られ、OmniDocBench のすべての列で改善が達成されました。

Three-panel overview of specialized OCR models
デプロイコストを決定する 3 つの軸。(a) ビジュアルトークンあたりのピクセル数(対数スケール)。DeepEncoder は 1024x1024 のビューを 4,096 パッチから 256 トークンにマッピングし、28~32 px パッチのエンコーダーが 783~1,022 ピクセルであるのに対し、ビジュアルトークンあたり 3,887 ピクセルを実現。(b) olmOCR-Bench におけるページスループット(A100 1基、コンカレンシー 32)。(c) アクティブパラメータ数に対するベンチマーク全体(対数スケール)。実線はパレート最適システムを結ぶ。jina-ocr-v1 は 570M のアクティブパラメータで両方のフロンティア上に位置する。
Serving efficiency of fourteen OCR systems ranked three ways
olmOCR-Bench における 14 のシステム(A100 1基、コンカレンシー 32)、(a) 毎秒出力トークン数、(b) ページあたり出力トークン数、(c) 毎秒ページ数(最初の 2 つの比率)の順位。Surya OCR 2 は毎秒 3,760 トークンでトップだが、ページあたり 3,568 トークンを出力し、毎秒 1.05 ページを完了する。jina-ocr-v1 は毎秒 2,792 トークンとページあたり 1,085 トークンを組み合わせ、2.57 に到達する。

tagモデルとトレーニング

長い出力は、ドキュメント解析のデコードコストを押し上げる要因です。DeepSeek-OCR は圧縮されたビジョンエンコーダーとコンパクトな MoE デコーダーでそのコストの大半を取り除きました。jina-ocr-v1 はこれらを引き継ぎ、残された自己回帰のボトルネックに対処します。

Architecture of jina-ocr-v1
アーキテクチャ。DeepEncoder と MoE デコーダーは DeepSeek-OCR に準拠し、1 ページから 256 個のビジュアルトークンによる 1024x1024 のグローバルビューと、100 トークンずつの n 個のローカルタイルが得られる。オレンジ色の FastMTP ヘッドは、デコーダーが検証するための K = 3 のトークンを 1 つの共有ドラフトブロックから提案する。

OCR の出力はほぼ決定論的であり、局所的に構造化されているため、推論(スペキュレーティブ)デコーディングに適したワークロードです。通常、この構成では予測の深さごとにドラフトヘッドを配置するため、モデルが先読みする距離に応じてドラフトパラメータが増加します。FastMTP は 1 つの密なブロックを K = 3 ステップにわたって再帰的に適用します。検証器は各提案を欲張り法(Greedy)でチェックし、ドラフトと検証器が一致する最長のプレフィックスを受け入れるため、確定したシーケンスは検証器の欲張りシーケンスと等しくなり、推論は出力時間の短縮のみに寄与します。

コンポーネント仕様
ビジョンエンコーダーDeepEncoder (~380M): SAM (80M) → 16x conv → CLIP-L (300M)
ビジョントークン256 @ 1024x1024 (Base); 256+100n, n ≤ 9 (Gundam, ≤ 1,156/page)
デコーダーDeepSeek-3B-MoE: 12 層, d = 1280, 64 ルーティング + 2 共有, top-6
アクティブ / 総パラメータ数~570M / ~3B (デコーダー); < 1B / ~3.4B (モデル全体)
語彙数129,280
位置制限32,768 (RoPE, θ = 106)
MTP ヘッド1 共有密ブロック, 再帰的 K = 3 ステップ (FastMTP)

モデル仕様。デコーダーは Markdown を出力し、テーブルは HTML、数式は LaTeX で記述されます。

トレーニングデータは、olmOCR-mix、FinePDFs、LightOnOCR、MMTab、UniMER などの公開 OCR コーパスに加え、Europeana の新聞、米国議会図書館の記録、NARA の年金記録といった意図的に困難なソースを利用しています。ルールベースのフィルターで退化したループや重複を除去し、ビジョン言語モデルによるパスで困難なソースに再ラベル付けを行いました。また、特定の理由でページを合成しています。自然なページでは数式やテーブルの報酬項が適用されるサンプルが非常に少ないため、ほとんどのロールアウトで構造的なシグナルが得られないからです。JinaOCRSynth は、各ページに採点可能な数式とテーブルを詰め込み、それらに付随するユニットテストも同梱しています。

ポストトレーニングでは、教師ありアライメント、劣化したページに対する堅牢性のファインチューニング、および GRPO を実行し、アウターループの各ラウンドで繰り返します。GRPO の報酬は、リファレンスのトランスクリプションに対して決定論的なコードによって計算された検証可能な項の積です。

コンポーネントシグナル役割
コンテンツ混合 LaTeX/HTML 上の正規化編集距離テキストの忠実度
数式数式文字列マッチング数式の正確さ
テーブルTEDS, TEDS-S, テーブル編集距離構造の復元
構造的妥当性括弧のバランス、タグの閉じ、テーブルの整合性整形式
ユニットテストolmOCR 形式の存在チェック、順序、数学およびテーブルテストの合格率高密度フィードバック
繰り返しと形式繰り返しペナルティ、HTML 適合性退化の抑制

乗法的な報酬構成。ほとんどの項には下限があります。積を使用する場合、1 つのチェックの失敗が、それ以外は正しいページから勾配を取り除いてしまう可能性があるためです。繰り返し項には下限はありません。退化ループはコンテンツスコアを最も不当に引き上げる障害モードであるためです。

各ラウンドで候補チェックポイントのプールが残ります。エージェントは固定された評価予算の下でマージ設定を検索し、ユニットテストと編集距離チェックでスコアを付けます。選択されたマージでのエラーが次の収集ラウンドを決定します。ドラフトヘッドは、ループが選択した検証器に対して最後に適合させられます。

tag結果

モデルパラメータ数ArXivOldScans-MathTablesOldScansMulti-colLongTinyHdr/FtrBase全体
Gemini 3 Flash–80.173.664.645.875.390.327.4––
Qwen3-VL-235B235B/22B88.481.286.749.685.988.933.6––
DeepSeek-OCR3B/570M77.574.577.333.167.383.096.199.376.0
dots.mocr3B85.985.590.748.285.381.694.099.783.9
olmOCR-28B82.982.184.348.384.381.4–99.782.4
LightOnOCR-21B89.685.689.042.284.891.419.799.683.2
chandra-ocr-24B86.989.192.151.182.193.791.499.985.8
jina-ocr-v13B/570M86.182.388.842.685.593.288.799.983.4

olmOCR-Bench において、jina-ocr-v1 は全体スコア 83.4 を達成しました。これはベースとなった DeepSeek-OCR よりも 7.4 ポイント高く、8B パラメータの olmOCR-2 をも上回っています。Hdr/Ftr カラムはテキストの不在をテストし、ヘッダーやフッターの省略を評価するため、ページ全体の忠実な書き起こしを行うシステムでは低スコアとなります。

手法パラメータ数全体 ↑TextEdit ↓FormulaCDM ↑TableTEDS ↑TableTEDS-S ↑ROEdit ↓
Gemini 3 Flash–92.620.06695.1689.2993.510.172
Qwen3-VL-235B235B/22B89.780.06392.5583.0786.750.166
DeepSeek-OCR-23B/570M90.250.05091.8483.8987.750.144
HunyuanOCR-1.51B94.740.03994.5093.6794.710.129
PaddleOCR-VL-1.60.9B96.340.03397.5394.7697.100.128
jina-ocr-v13B/570M91.140.04693.2884.6889.010.142

OmniDocBench v1.6 において、jina-ocr-v1 は 570M のアクティブパラメータ数で 91.14 を達成し、すべての項目で DeepSeek-OCR-2 を上回ったほか、はるかに大規模な Qwen3-VL-235B をも凌駕しました。

tagL4 GPU での投機的デコード

モードk出力 詞元/s ↑高速化 S ↑受け入れ率τc ↓
Eager042.71.00x––1.00
Eager164.01.50x82.6%1.831.22
Eager277.91.82x69.1%2.381.30
Eager383.11.95x57.6%2.731.40
Graph0158.31.00x––1.00
Graph1185.61.17x82.9%1.831.56
Graph2183.81.16x69.3%2.382.05
Graph3172.91.09x57.9%2.742.51

FastMTP(olmOCR-Bench、NVIDIA L4、vLLM 0.20.1、バッチサイズ 1)での測定結果。τ はボーナス詞元を含む投機的ステップごとに確定した平均詞元数、c = τ/S は自己回帰ステップ 1 回分を単位とした投機的ステップ 1 回分のコストです。上記図とは異なるデバイスで測定されました。

k = 3 の場合、τ は Eager モードで 2.73、CUDA グラフ下で 2.74 となり、ドラフト品質は実行モードに依存しません。ベースラインは依存します。CUDA グラフを使用すると自己回帰デコードは 42.7 から 158.3 詞元/秒へと向上しますが、投機的ステップのオーバーヘッドは約 9 ms のままであるため、そのコストは自己回帰ステップ 1.40 回分から 2.51 回分へと上昇します。このゲインは置き換え対象となる検証ステップのコストに追随するため、Eager モードでは k = 3、グラフモードでは k = 1 が最適な深さとなります。

tagはじめに

最も素早く実行する方法は Jina Reader を使うことです。r.jina.ai に URL を指定し、ヘッダーを 1 つ追加するだけで、Reader がページや PDF を取得・レンダリングし、その結果に対して jina-ocr-v1 を実行して Markdown を返します。デプロイの必要はなく、画像処理の実装も不要で、プラットフォームの他の機能と同じ API キーがそのまま利用可能です。

curl "https://r.jina.ai/https://example.com/document.pdf" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -H "X-Respond-With: jina-ocr-v1"

X-Page を追加すれば、複数ページのドキュメントから 1 ページを書き起こせます。両方のパラメータは Reader API エディターにあり、トグルを切り替えるだけでヘッダーが自動的に作成されます。

モデルへの直接アクセスには、OpenAI 互換のホスト型エンドポイントをご利用ください。jina.ai で取得した API キーのみが必要です。

curl https://api.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
    "model": "jina-ocr-v1",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Transcribe the provided document image into a clean Markdown format, preserving the natural reading order."},
        {"type": "image_url", "image_url": {"url": "https://example.com/document.png"}}
      ]
    }]
  }'

ご自身でサービングする場合は、重みとカスタムモデリングコードが 1 つの Hugging Face リポジトリに格納されています。trust_remote_code=True でロードしてください。FastMTP には vLLM 0.21 以降と、エンジン起動前の 1 回限りのアーキテクチャ登録が必要です。

import sys
from huggingface_hub import snapshot_download
from PIL import Image
from vllm import LLM

sys.path.insert(0, snapshot_download('jinaai/jina-ocr-v1'))
from deepseek_ocr_mtp import DEFAULT_OCR_PROMPT, register, vllm_llm_kwargs, vllm_sampling_params

register()
llm = LLM(**vllm_llm_kwargs('jinaai/jina-ocr-v1',
                            num_speculative_tokens=3,
                            mtp_heads=1,
                            mtp_recursive=True))

image = Image.open('document.png').convert('RGB')
outputs = llm.chat(
    [{'role': 'user', 'content': [{'type': 'image_pil', 'image_pil': image},
                                  {'type': 'text', 'text': DEFAULT_OCR_PROMPT}]}],
    sampling_params=vllm_sampling_params(max_tokens=4096),
)
print(outputs[0].outputs[0].text)

高速化を実現するには 1 つのポイントがあります。ヘルパーは method="eagle" でヘッドを登録します。FastMTP は再帰的な隠れ状態フィードバックで学習されており、デフォルトの method="mtp" はドラフトステップごとにターゲットに対して再グラウンディングを行うためです。Transformers のパスでは MoE デコーダーのみが実行され、MTP の重みは無視されます。

本モデルは、表や数式の要素レベルの書き起こし、キャプション作成、ドキュメント VQA(視覚的質問応答)、重要情報抽出にも英語および中国語で対応しています。重みは CC BY-NC 4.0 ライセンスで公開されています。

tag結論

jina-ocr-v1 は 570M のアクティブパラメータ数で両ベンチマークの精度・パラメータ効率の境界線を維持しており、測定したシステムの中で最高のページ処理スループットを誇ります。これを実現しているのは、より大規模なモデルを必要としない 2 つのレバーです。それは、検証可能なチェックに対する段階的な報酬と、最終的な検証器に対して学習されたドラフトヘッドです。

出力の長さも検討に値します。詞元スループットとページスループットではシステムの順位付けが異なり、出力の長さは解析品質から独立しているため、簡潔さはそれ自体で最適化が可能です。jina-ocr-v1 は、83 を超えるスコアを持つすべてのシステムの中で最も短い出力を提供します。

カテゴリー:
star
注目
プレスリリース
rss_feed

続きを読む
8月 03, 2026 • 11 読む時間
jina-reranker-v3.5: ハイブリッドアテンションと自己蒸留による高速なリストワイズ・リランカー
Jina AI
5月 12, 2026 • 7 読む時間
jina-embeddings-v5-omni:テキスト、画像、音声、動画のための向量模型
Jina AI
2月 19, 2026 • 7 読む時間
jina-embeddings-v5-text: 新しい SOTA 小型多言語ベクトルモデル
Jina AI
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。