I/O 图 1
I/O 图 2
I/O 图 3
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
选择要比较的模型
论文 (1)
概述
ReaderLM-v2 是一款 15 亿参数的语言模型,可把原始 HTML 转换为 Markdown 或 JSON,输入输出合计长度最高支持 512K 词元,覆盖 29 种语言。上一代把 HTML 转 Markdown 当作「选择性复制」任务,而 v2 把它视为一种翻译过程,因此能更好地处理代码围栏、嵌套列表、表格和 LaTeX 公式等复杂元素。该模型在不同上下文长度下表现稳定,并新增了按预定义 schema 直接生成 JSON 的能力。
方法
ReaderLM-v2 基于 Qwen2.5-1.5B-Instruction 构建,训练使用了包含上千万篇 HTML 文档的 html-markdown-1m 数据集,每篇平均 56,000 词元。训练流程包括:1) 采用 ring-zag 注意力和 RoPE 做长上下文预训练,把上下文从 32K 词元扩展到 256K 词元;2) 用精修数据集做监督微调;3) 用直接偏好优化对齐输出;4) 自博弈强化调优。数据准备遵循由 Qwen2.5-32B-Instruction 驱动的三步流程(起草-精修-评审),先为各项任务训练专用模型,再通过线性参数插值合并。
性能
在综合基准测试中,ReaderLM-v2 在 HTML 转 Markdown 任务上的表现优于 Qwen2.5-32B-Instruct、Gemini2-flash-expr 等更大的模型。正文提取方面,ROUGE-L 达 0.84,Jaro-Winkler 达 0.82,Levenshtein 距离仅 0.22,明显低于同类。HTML 转 JSON 任务上同样表现不俗,F1 为 0.81,通过率达 98%。在 T4 GPU 上,输入处理速度为每秒 67 词元,输出为每秒 36 词元;借助对比损失训练,退化问题也大幅减少。
最佳实践
模型配有 Google Colab notebook,演示了 HTML 转 Markdown、JSON 提取和指令跟随。HTML 转 Markdown 任务可直接输入原始 HTML,无需前缀指令;JSON 提取则需要指定 schema 格式。辅助函数 create_prompt 可帮您快速为这两类任务构造提示词。模型能在 Colab 的免费 T4 GPU 上运行(需要 vllm 和 triton),但缺少 bfloat16 和 Flash Attention 2 支持时会有所受限。生产环境建议使用 RTX 3090/4090。该模型将上架 AWS SageMaker、Azure 和 GCP 市场,以 CC BY-NC 4.0 协议授权,仅限非商业用途。
提及此模型的博客









