Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
データ取り込み
copyright CC BY-NC 4.0
open_in_new リリース記事

jina-ocr-v1

1 パスでページを Markdown に変換するドキュメントパーサー(570M アクティブパラメータ)
ライセンス
copyright CC-BY-NC-4.0
発売日
calendar_month
2026-09-14
入力
image
画像
picture_as_pdf
PDF
arrow_forward
出力
abc
テキスト
モデル詳細
パラメータ: 3.4B
入力トークン長: 32K
入力画像サイズ: 1024×1024
ベースモデル help_outline
open_in_new
DeepSeek-OCR
訓練された言語 help_outline
25 言語
サポートされている言語 help_outline
108 言語
関連機種
link
ReaderLM-v2
link
jina-vlm
以下の方法で入手できます
Jina API
Hugging Face
I/O 図

画像

jina-ocr-v1

PDF

マークダウン

パレートフロンhelp_outline
olmOCR-Bench
OmniDocBench v1.6
chevron_leftchevron_right
1B3.0B10B406080Qwen2-VL-7BQwen2.5-VL-7BDeepSeek-OCRdots.mocrolmOCR-2LightOnOCR-2chandra-ocr-2Nanonets-OCR2-3BInfinity-Parser-7BChandra-OCR-0.1.0GOT-OCRQwen2-VL-7BQwen2.5-VL-7BPaddleOCR-VLMinerU-2.5jina-ocr-v1パラメータ数(対数)score
このモデル
フロン上
Jina AI
その他
olmOCR-Bench
83.40
パラメータ
3.4B
スコア順位
3 / 16
パレートフロン
フロン未満
比較するモデルを選択してください
論文 (1)
arXiv
9月 02, 2026
jina-ocr-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

概要

jina-ocr-v1 は 1 パスでページを Markdown に変換します:テキスト、数式、テーブル、読み順をすべて一緒に。差別化ポイントは、エンジニアリングがどこに向かったかです。パーシング品質は競争が激しいため、モデルは本番環境で実際にコストがかかる部分、すなわちデコーディングに挑みます。OCR 出力は局所的に予測可能なので、モデルは 3 トークン先読みで素案をたたき、検証者が貪欲にチェックします。検証が貪欲なため、結果は ロスレス(通常の自動回帰デコーディングとバイト単位で同一)となり、モデルは 1 トークンの代わりに検証 1 パスあたり最大 2.7 トークン を確定します。

同じ目標からすべてが導かれます。総パラメータ 3.4B の Mixture of Experts ですが、1 トークンあたりアクティブなのは約 570M しかなく、実行コストは小規模モデルながら、容量はそうではありません。既定の動的解像度設定では、OmniDocBench v1.6 が 91.14、olmOCR-Bench が 83.4 です。

言語カバレッジはベースモデルから受け継がれます。DeepSeek-OCR は 約 100 言語 にわたる 3,000 万の PDF ページで事前学習され、jina-ocr-v1 はそのエンコーダとデコーダを維持しているため、ドキュメント解析にも同じ広さが適用されます。

ReaderLM-v2 は抽出済み HTML を Markdown へ変換します。jina-ocr-v1 はその 1 ステップ手前から始まり、レンダリングされたページ自体を読みます。

方法

アーキテクチャは DeepSeek-OCR の DeepEncoder と Mixture of Experts デコーダを継承しています。DeepEncoder は約 380M パラメータで、80M の SAM ステージから 16 倍のコンボリューション圧縮器、さらに 300M の CLIP-L ステージへ直列接続され、1024x1024 のページはわずか 256 ビジュアルトークン のコストに収まります。Gundam 動的解像度モードではタイル 1 つ追加ごとに 100 トークン加算され、ページあたり最大 1,156 トークンです。デコーダは 12 レイヤー、隠れ次元 1280、ルーティングエキスパート 64 個+共有 2 個(top-6 ルーティング)、語彙 129,280 トークン、ポジション上限 32,768 の DeepSeek-3B-MoE です。

デコーディング速度は FastMTP によるものです。K 個の独立したヘッドではなく、単一の密なドラフトブロックを K=3 の予測ステップにわたって再帰的に適用します。検証は貪欲なので、投機的経路は ロスレス です。出力されるテキストは、通常の自動回帰デコーディングが生成するものと同一です。

ポストトレーニングでは、インストラクションアラインメント、困難で劣化した文書に対する頑健性ファインチューニング、そして高密度の検証可能リワードによる GRPO を実行します。このリワードは、パス/フェイルの単一シグナルではなく部分点を付与する、決定論的な数式・テーブル・構造チェックです。学習データは、olmOCR-mix、FinePDFs、DoclingMatrix、SynthChartNet、UniMER といったクリーニング済みの公開 OCR コーパスに加えて、Europeana の新聞、Library of Congress の写録、NARA の年金ファイルといった歴史・劣化資料、さらにリワードが必要な箇所でカバレッジを持たせるため olmOCR-Bench 風のユニットテストを載せたターゲット合成ページを混ぜています。

パフォーマンス

olmOCR-Bench での全体スコアは 83.4 です。サブセット別では Base 99.9(比較内で同率首位)、続いて LongTiny 93.2、Tables 88.8、Hdr/Ftr 88.7、ArXiv 86.1、Multi-column 85.5、OldScans-Math 82.3、OldScans 42.6 です。OmniDocBench v1.6 では全体 91.14、テキスト編集距離 0.046、数式 CDM 93.28、テーブル TEDS 84.68、TEDS-S 89.01、読み順編集距離 0.142 です。

効率こそがモデルのポイントです。A100 SXM4 40GB 1 台、並行度 32、1,403 ページでの測定では、比較内で最速の 2.57 ページ/秒 を維持し、olmOCR-2 の 1.22 に対してほぼ 2 倍です。ページあたり出力トークンは 1,085、秒あたり 2,792 です。スコアの高いモデルははるかに遅く、chandra-ocr-2 は 85.8 で品質首位ですが 0.38 ページ/秒、dots.mocr は 0.55 ページ/秒で 83.9 です。トークン数値は競争力がありますが、プールの最良ではありません。PaddleOCR-VL-1.6 がページあたり 1,048 と軽く、Surya OCR 2 は秒あたり 3,760 と多めです。

投機的デコーディングが安価な GPU を現実的にします。NVIDIA L4(バッチサイズ 1)では、FastMTP が K=3 で eager モードのデコーディングを 42.7 から 83.1 出力トークン/秒まで引き上げ、受入率 57.6% で 1.95 倍 の高速化です。CUDA グラフを使うとベースラインはすでに 158.3 トークン/秒で、最適な動作点は 185.6 の K=1(1.17 倍の向上)です。これらの L4 数値は別ハードウェアでのバッチサイズ 1 測定のため、上記の A100 スループット数値とは比較できません。

ベストプラクティス

一般的なドキュメントには既定の動的解像度設定を使用してください。報告済みスコアの元になった構成です。出力は Markdown なので、テーブルと数式は構造化済みの状態で届き、別途のポストプロセッシングは不要です。モデルは低コスト GPU を対象としています。単一ドキュメントのインタラクティブな解析には L4 や同等機で十分です。投機的デコーディングは eager モードで最大の効果があるため、そちらでは K=3 を、CUDA グラフ使用時は K=1 を有効にしてください。検証は貪欲なので、投機的デコーディングのオンオフはスループットを変えますが、テキストは変わりません。

大容量のドキュメント取り込み、PDF→Markdown パイプライン、スキャン・歴史資料のアーカイブ、そしてドルあたりのページ/秒がベンチマーク最後の 1 ポイントより重要なワークロードに最適です。ヘッダーとフッターは除外せず転記されます。アーカイブ忠実度では望ましい挙動ですが、テキスト欠如テストでは低スコアになります。OldScans は最弱のサブセット(42.6)のままなので、劣化の激しいスキャンは引き続き人手チェックが必要です。

入力にすでに取得済みの HTML がある場合、同じ Markdown 目標には ReaderLM-v2 の方が安価です。ページへの視覚質問応答(転記ではないケース)には jina-vlm を、解析済み出力上の検索には jina-embeddings-v4 と組み合わせてください。

このモデルについて言及しているブログ
9月 14, 2026 • 9 読む時間
jina-ocr-v1:低予算GPUで高速な文書解析を実現
jina-ocr-v1 は、34億のパラメータ数と5億7000万の有効パラメータ数を持つビジョン言語モデルであり、OmniDocBench v1.6 で 91.1、olmOCR-Bench で 83.4 のスコアを記録しています。
Jina AI
jina-ocr-v1
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するコンテンツ、ソフトウェア、製品、サービスは、すべて専門的な利用を目的としています。消費者向けの利用は想定していません。