I/O 圖 1
I/O 圖 2
I/O 圖 3
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
選擇要比較的模型
論文 (1)
概述
ReaderLM-v2 是一款 15 億參數的語言模型,可把原始 HTML 轉換為 Markdown 或 JSON,輸入輸出合計長度最高支援 512K 詞元,覆蓋 29 種語言。上一代把 HTML 轉 Markdown 當作「選擇性複製」任務,而 v2 把它視為一種翻譯過程,因此能更好地處理程式碼圍欄、巢狀列表、表格和 LaTeX 公式等複雜元素。該模型在不同上下文長度下表現穩定,並新增了按預定義 schema 直接生成 JSON 的能力。
方法
ReaderLM-v2 基於 Qwen2.5-1.5B-Instruction 構建,訓練使用了包含上千萬篇 HTML 文件的 html-markdown-1m 資料集,每篇平均 56,000 詞元。訓練流程包括:1) 採用 ring-zag 注意力和 RoPE 做長上下文預訓練,把上下文從 32K 詞元擴充套件到 256K 詞元;2) 用精修資料集做監督微調;3) 用直接偏好最佳化對齊輸出;4) 自博弈強化調優。資料準備遵循由 Qwen2.5-32B-Instruction 驅動的三步流程(起草-精修-評審),先為各項任務訓練專用模型,再透過線性引數插值合併。
效能
在綜合基準測試中,ReaderLM-v2 在 HTML 轉 Markdown 任務上的表現優於 Qwen2.5-32B-Instruct、Gemini2-flash-expr 等更大的模型。正文提取方面,ROUGE-L 達 0.84,Jaro-Winkler 達 0.82,Levenshtein 距離僅 0.22,明顯低於同類。HTML 轉 JSON 任務上同樣表現不俗,F1 為 0.81,透過率達 98%。在 T4 GPU 上,輸入處理速度為每秒 67 詞元,輸出為每秒 36 詞元;藉助對比損失訓練,退化問題也大幅減少。
最佳實踐
模型配有 Google Colab notebook,演示了 HTML 轉 Markdown、JSON 提取和指令跟隨。HTML 轉 Markdown 任務可直接輸入原始 HTML,無需字首指令;JSON 提取則需要指定 schema 格式。輔助函式 create_prompt 可幫您快速為這兩類任務構造提示詞。模型能在 Colab 的免費 T4 GPU 上執行(需要 vllm 和 triton),但缺少 bfloat16 和 Flash Attention 2 支援時會有所受限。生產環境建議使用 RTX 3090/4090。該模型將上架 AWS SageMaker、Azure 和 GCP 市場,以 CC BY-NC 4.0 協議授權,僅限非商業用途。
提及此模型的部落格









