Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
warning
此模型已被更新的模型取代。
Reader
copyright CC BY-NC 4.0
open_in_new 发布博客

reader-lm-0.5b

用于将原始 HTML 转换为 Markdown 的小型语言模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2024-08-11
输入
abc
文本(HTML)
arrow_forward
输出
abc
文本(Markdown)
模型详情
参数: 494M
输入词元长度: 256K
底座模型 help_outline
open_in_new
Qwen2-0.5B-Instruct
已训练语言 help_outline
2 种语言
支持的语言 help_outline
29 种语言
相关模型
link
reader-lm-1.5b
可通过以下方式获取
AWS SageMaker
微软云
Hugging Face
物理隔离
I/O 图

HTML

reader-lm

Markdown

帕累托前沿help_outline
Reader-LM v1 HTML-to-Markdown
Reader-LM v1 HTML-to-Markdown · TER
chevron_leftchevron_right
1B3.0B10B30B100B0.20.30.40.50.60.7llama-3.1-70bQwen2-7B-Instructreader-lm-1.5breader-lm-0.5b参数量(对数)ROUGE-L
本模型
在前沿上
Jina AI
其他
Reader-LM v1 HTML-to-Markdown
0.560
参数量
494M
按分数的排名
2 / 4
帕累托前沿
在前沿上
选择要比较的模型

概述

Reader LM 0.5B 是一款专用语言模型,用于攻克把 HTML 文档转换为干净、结构化 Markdown 文本这一难题。它满足了现代数据处理流程中的一项关键需求:高效地把杂乱的网页内容整理成适合大模型和文档系统使用的格式。通用语言模型往往需要大量算力,而 Reader LM 0.5B 仅用 4.94 亿参数就能完成专业级的 HTML 处理,算力有限的团队也能轻松用上。需要处理网页内容、实现文档自动化或构建大模型应用的团队,会发现它能大幅简化内容准备流程。

方法

该模型采用创新的「浅而宽」架构,专为选择性复制而非创意文本生成而优化。它以纯解码器为基础,含 24 层、896 维隐藏层,注意力机制配置为 14 个查询头和 2 个键值头,可高效处理输入序列。训练分两个阶段:先用较短、较简单的 HTML(32K 词元)学习基本转换规律,再用复杂的真实 HTML(128K 词元)应对疑难场景。训练中引入对比搜索,并加入重复检测机制,避免出现词元循环之类的退化问题。架构上的一大特色是锯齿环形注意力机制,让模型能稳定处理长达 256K 词元的超长序列。

性能

在实际测试中,Reader LM 0.5B 在多个指标上都展现出出色的性价比。ROUGE-L 得分 0.56,说明内容保留完整;词元错误率低至 0.34,几乎不产生幻觉。在涵盖多语言新闻、博客和电商页面的 22 个 HTML 来源上做定性评估,它在结构保留和 Markdown 语法运用方面表现突出。面对内联 CSS 和脚本动辄膨胀到数十万词元的复杂现代网页,传统规则方法往往失效,而该模型应对自如。不过需要说明的是,它在常规的 HTML 转 Markdown 任务上表现极佳,但对于高度动态或重度依赖 JavaScript 的页面,可能还需要额外处理。

最佳实践

要有效部署 Reader LM 0.5B,需确保基础设施满足模型的 CUDA 要求;不过得益于高效的架构,它也能在消费级 GPU 上运行。该模型直接接受原始 HTML 输入,无需特殊前缀或指令。为获得最佳效果,请启用官方提供的重复检测机制,避免输出生成时出现词元循环。模型虽然支持多种语言和各类 HTML 结构,但专为内容提取和 markdown 转换设计,不适合文本生成、摘要或直接问答等任务。生产部署可通过 AWS SageMaker,此外还提供 Google Colab notebook 供测试和试验。需要注意的是,模型虽可处理长达 256K 词元的超长文档,但处理这类超大输入可能需要额外的内存管理策略。
提及此模型的博客
一月 15, 2025 • 17 分钟阅读
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
九月 11, 2024 • 13 分钟阅读
Reader-LM: Small Language Models for Cleaning and Converting HTML to Markdown
Reader-LM-0.5B and Reader-LM-1.5B are two novel small language models inspired by Jina Reader, designed to convert raw, noisy HTML from the open web into clean markdown.
Jina AI
Technical screenshot displaying "REAPER-LM-0.5B/1.5B" with HTML source code for Jina's search grounding feature.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。