I/O 図 1

HTML

ReaderLM-v2

マークダウン

I/O 図 2

HTML

ReaderLM-v2

命令

JSON

I/O 図 3

HTML

ReaderLM-v2

命令

マークダウン

比較するモデルを選択してください
論文 (1)

概要

ReaderLM-v2 は1.54Bパラメータの小型言語モデルで、乱雑なHTMLを高精度でクリーンなMarkdownまたはJSONに変換し、最大512Kトークンの文書を処理します。LLMのgroundingに最適なツール:WebコンテンツをLLMが効率的に消費できる構造化形式に変換。HTML-to-MarkdownでQwen2.5-32B-InstructやGemini2-flash-exprを上回る — コストはその一部に過ぎない。

方法

このモデルの有効性には 2 つの重要なイノベーションが寄与しています。第一に、3 段階のデータ合成パイプラインが、Web コンテンツ抽出を反復的にドラフト・リファイン・批評することで、高品質かつ多様な学習データを生成します — この合成データアプローチにより、手動アノテーションなしに多様な HTML 構造をモデルが参照できます。第二に、統合学習フレームワークが継続的事前学習と多目的最適化を組み合わせ、HTML から Markdown への変換と HTML から JSON への変換を同時に学習可能にします。'shallow-but-wide'(浅く広い)デコーダーオンリーアーキテクチャ(28 レイヤー、1536 隠れ次元、12 クエリヘッド、2 KV ヘッド)は選択的なコピー操作に最適化されています。512K トークンのコンテキストは zigzag-ring-attention により実現されています。対比損失による学習が劣化問題を大幅に軽減します。

パフォーマンス

HTML から Markdown への変換タスクでは、このモデルは ROUGE-L 0.84、Jaro-Winkler 0.82、Levenshtein 距離 0.22 を達成し、Qwen2.5-32B-Instruct と Gemini2-flash-expr を上回っています。HTML から JSON への変換タスクでは、F1 スコア 0.81、パス率 98% で競争力を維持しています。T4 GPU では入力 67 tokens/s、出力 36 tokens/s で処理します。劣化問題(トークンループ、反復出力)は対比損失トレーニングにより大幅に軽減されています。512K トークンのコンテキストウィンドウにより、実世界のほとんどの文書でチャンキングが不要になります。

ベストプラクティス

このモデルは、HTML から Markdown への変換、JSON 抽出、指示追従をデモンストレーションする Google Colab ノートブックを通じて利用できます。HTML から Markdown への変換タスクでは、プレフィックス指示なしで生の HTML を入力してください。JSON 抽出では、プロンプトで対象スキーマを指定してください。create_prompt ヘルパー関数が両タスクのプロンプト作成を容易にします。モデルは Colab の無料 T4 GPU ティアで動作しますが(vllm と triton が必要)、bfloat16 または Flash Attention 2 がない場合は制約があります。本番環境には RTX 3090/4090 を推奨します。AWS SageMaker、Azure、GCP マーケットプレイスで利用可能です。非商用利用のために CC BY-NC 4.0 でライセンスされています。RAG パイプラインの前処理ステップとして、jina-embeddings-v5-text-small で埋め込む前に Web コンテンツをきれいな Markdown に変換するために、このモデルを使用してください。

このモデルについて言及しているブログ
5月 25, 2025 • 21 読む時間
ICLR2025で学んだこと
ICLR 2025で最も興味深い論文をいくつか集めました。TIPS、FlexPrefill、ゼロショット重排器 (Zero-Shot Rerankers)、SVD-LLM、Hymbaなどが含まれています。
5月 07, 2025 • 9 読む時間
埋め込みに対する Model Soup のレシピ
モデルスープでロバスト性とパフォーマンスを向上:重みを平均化します。追加コストなしで、より良い結果が得られます。
4月 08, 2025 • 21 読む時間
jina-reranker-m0:多言語マルチモーダルドキュメントリランカー
視覚的なドキュメントを検索するための新しい多言語・マルチモーダルリランカー jina-reranker-m0 を紹介します。多言語の長文ドキュメントやコード検索タスクにおいて、最先端(SOTA)の性能を実現しています。
1月 31, 2025 • 14 読む時間
実践的な検索基盤モデルの本番環境へのデプロイメントガイド
3つのデプロイメント戦略(Jina API、セルフホスト型 K8s、AWS SageMaker)について、コストとパフォーマンスの詳細な内訳を提供し、適切な判断をサポートします。
1月 15, 2025 • 17 読む時間
ReaderLM v2:HTML から Markdown と JSON への変換を行う最先端の小規模言語モデル
ReaderLM-v2 は、HTML から Markdown への変換と HTML から JSON への抽出を高精度で行う 1.5B の小規模な言語モデルです。