I/O 图
帕累托前沿help_outline
chevron_leftchevron_right
本模型
在前沿上
Jina AI
其他
Reader-LM v1 HTML-to-Markdown
0.560
参数量
494M
按分数的排名
2 / 4
帕累托前沿
在前沿上
选择要比较的模型
概述
Reader LM 0.5B 是一款专用语言模型,用于攻克把 HTML 文档转换为干净、结构化 Markdown 文本这一难题。它满足了现代数据处理流程中的一项关键需求:高效地把杂乱的网页内容整理成适合大模型和文档系统使用的格式。通用语言模型往往需要大量算力,而 Reader LM 0.5B 仅用 4.94 亿参数就能完成专业级的 HTML 处理,算力有限的团队也能轻松用上。需要处理网页内容、实现文档自动化或构建大模型应用的团队,会发现它能大幅简化内容准备流程。
方法
该模型采用创新的「浅而宽」架构,专为选择性复制而非创意文本生成而优化。它以纯解码器为基础,含 24 层、896 维隐藏层,注意力机制配置为 14 个查询头和 2 个键值头,可高效处理输入序列。训练分两个阶段:先用较短、较简单的 HTML(32K 词元)学习基本转换规律,再用复杂的真实 HTML(128K 词元)应对疑难场景。训练中引入对比搜索,并加入重复检测机制,避免出现词元循环之类的退化问题。架构上的一大特色是锯齿环形注意力机制,让模型能稳定处理长达 256K 词元的超长序列。
性能
在实际测试中,Reader LM 0.5B 在多个指标上都展现出出色的性价比。ROUGE-L 得分 0.56,说明内容保留完整;词元错误率低至 0.34,几乎不产生幻觉。在涵盖多语言新闻、博客和电商页面的 22 个 HTML 来源上做定性评估,它在结构保留和 Markdown 语法运用方面表现突出。面对内联 CSS 和脚本动辄膨胀到数十万词元的复杂现代网页,传统规则方法往往失效,而该模型应对自如。不过需要说明的是,它在常规的 HTML 转 Markdown 任务上表现极佳,但对于高度动态或重度依赖 JavaScript 的页面,可能还需要额外处理。
最佳实践
要有效部署 Reader LM 0.5B,需确保基础设施满足模型的 CUDA 要求;不过得益于高效的架构,它也能在消费级 GPU 上运行。该模型直接接受原始 HTML 输入,无需特殊前缀或指令。为获得最佳效果,请启用官方提供的重复检测机制,避免输出生成时出现词元循环。模型虽然支持多种语言和各类 HTML 结构,但专为内容提取和 markdown 转换设计,不适合文本生成、摘要或直接问答等任务。生产部署可通过 AWS SageMaker,此外还提供 Google Colab notebook 供测试和试验。需要注意的是,模型虽可处理长达 256K 词元的超长文档,但处理这类超大输入可能需要额外的内存管理策略。
提及此模型的博客


