概要
ReaderLM-v2 は1.54Bパラメータの小型言語モデルで、乱雑なHTMLを高精度でクリーンなMarkdownまたはJSONに変換し、最大512Kトークンの文書を処理します。LLMのgroundingに最適なツール:WebコンテンツをLLMが効率的に消費できる構造化形式に変換。HTML-to-MarkdownでQwen2.5-32B-InstructやGemini2-flash-exprを上回る — コストはその一部に過ぎない。
方法
このモデルの有効性には 2 つの重要なイノベーションが寄与しています。第一に、3 段階のデータ合成パイプラインが、Web コンテンツ抽出を反復的にドラフト・リファイン・批評することで、高品質かつ多様な学習データを生成します — この合成データアプローチにより、手動アノテーションなしに多様な HTML 構造をモデルが参照できます。第二に、統合学習フレームワークが継続的事前学習と多目的最適化を組み合わせ、HTML から Markdown への変換と HTML から JSON への変換を同時に学習可能にします。'shallow-but-wide'(浅く広い)デコーダーオンリーアーキテクチャ(28 レイヤー、1536 隠れ次元、12 クエリヘッド、2 KV ヘッド)は選択的なコピー操作に最適化されています。512K トークンのコンテキストは zigzag-ring-attention により実現されています。対比損失による学習が劣化問題を大幅に軽減します。
パフォーマンス
HTML から Markdown への変換タスクでは、このモデルは ROUGE-L 0.84、Jaro-Winkler 0.82、Levenshtein 距離 0.22 を達成し、Qwen2.5-32B-Instruct と Gemini2-flash-expr を上回っています。HTML から JSON への変換タスクでは、F1 スコア 0.81、パス率 98% で競争力を維持しています。T4 GPU では入力 67 tokens/s、出力 36 tokens/s で処理します。劣化問題(トークンループ、反復出力)は対比損失トレーニングにより大幅に軽減されています。512K トークンのコンテキストウィンドウにより、実世界のほとんどの文書でチャンキングが不要になります。
ベストプラクティス
このモデルは、HTML から Markdown への変換、JSON 抽出、指示追従をデモンストレーションする Google Colab ノートブックを通じて利用できます。HTML から Markdown への変換タスクでは、プレフィックス指示なしで生の HTML を入力してください。JSON 抽出では、プロンプトで対象スキーマを指定してください。create_prompt ヘルパー関数が両タスクのプロンプト作成を容易にします。モデルは Colab の無料 T4 GPU ティアで動作しますが(vllm と triton が必要)、bfloat16 または Flash Attention 2 がない場合は制約があります。本番環境には RTX 3090/4090 を推奨します。AWS SageMaker、Azure、GCP マーケットプレイスで利用可能です。非商用利用のために CC BY-NC 4.0 でライセンスされています。RAG パイプラインの前処理ステップとして、jina-embeddings-v5-text-small で埋め込む前に Web コンテンツをきれいな Markdown に変換するために、このモデルを使用してください。









