概述
ReaderLM-v2 是一個 1.54B 參數的小型語言模型,能以高準確率將雜亂的 HTML 轉換為乾淨的 Markdown 或 JSON,可處理長達 512K token 的文件。它是為大型語言模型提供接地(grounding)的理想工具:將網頁內容轉換為 LLM 可高效消費的格式。該模型在 HTML 轉 Markdown 任務上表現優於 Qwen2.5-32B-Instruct 和 Gemini2-flash-expr,而運行成本僅為其一小部分。
方法
該模型的有效性來自兩項關鍵創新。首先,三階段資料合成流水線透過反覆起草、精煉和批評網頁內容擷取來產生高品質、多樣的訓練資料——這種合成資料方法確保模型無需人工標註即可見多樣的 HTML 結構。其次,統一的訓練框架將連續預訓練與多目標最佳化相結合,使模型能夠同時學習 HTML 轉 Markdown 和 HTML 轉 JSON 轉換。'淺而寬'(shallow-but-wide)的解碼器專屬架構(28 層、1536 隱藏維度、12 個查詢頭、2 個 KV 頭)針對選擇性複製操作進行了最佳化。512K token 上下文透過 zigzag-ring-attention 實現。對比損失訓練顯著減少了退化問題。
效能
在 HTML 轉 Markdown 任務上,該模型取得 ROUGE-L 0.84、Jaro-Winkler 0.82、Levenshtein 距離 0.22,超過 Qwen2.5-32B-Instruct 和 Gemini2-flash-expr。在 HTML 轉 JSON 任務上,它以 F1 分數 0.81、98% 通過率保持有競爭力的表現。在 T4 GPU 上,該模型以輸入 67 tokens/s、輸出 36 tokens/s 的速度處理。退化問題(token 循環、重複輸出)透過對比損失訓練顯著減少。512K token 上下文視窗消除了大多數實際文件的分塊需求。
最佳實踐
該模型可透過 Google Colab 筆記本存取,其中示範了 HTML 轉 Markdown、JSON 提取和指令遵循。對於 HTML 轉 Markdown 任務,直接輸入原始 HTML,無需前置指令。對於 JSON 提取,在提示中指定目標結構。create_prompt 輔助函數便於為兩種任務建立提示。該模型可在 Colab 免費 T4 GPU 層級運行(需要 vllm 和 triton),但不支援 bfloat16 或 Flash Attention 2 時存在限制;生產環境建議使用 RTX 3090/4090。可透過 AWS SageMaker、Azure 和 GCP 市場取得。以 CC BY-NC 4.0 授權用於非商業用途。將此模型作為 RAG 流水線中的預處理步驟,在使用 jina-embeddings-v5-text-small 嵌入之前將網頁內容轉換為乾淨的 Markdown。









