Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
Reader
copyright CC BY-NC 4.0
open_in_new 发布博客

ReaderLM-v2

将原始 HTML 转换为 markdown 或 JSON 的前沿小型语言模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2025-01-16
输入
abc
文本(HTML)
arrow_forward
输出
abc
文本(Markdown)
abc
文本(JSON)
模型详情
参数: 1.54B
输入词元长度: 512K
底座模型 help_outline
open_in_new
Qwen2.5-1.5B-Instruct
已训练语言 help_outline
14 种语言
支持的语言 help_outline
29 种语言
相关模型
link
reader-lm-1.5b
可通过以下方式获取
Jina API
AWS SageMaker
微软云
谷歌云
Hugging Face
物理隔离
I/O 图 1

HTML

ReaderLM-v2

Markdown

I/O 图 2

HTML

ReaderLM-v2

指令

JSON

I/O 图 3

HTML

ReaderLM-v2

指令

Markdown

选择要比较的模型
论文 (1)
ICLR 2025
三月 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

概述

ReaderLM-v2 是一个 1.54B 参数的小型语言模型,能以高准确率将杂乱的 HTML 转换为干净的 Markdown 或 JSON,可处理长达 512K token 的文档。它是为大语言模型提供接地(grounding)的理想工具:将网页内容转换为 LLM 可高效消费的格式。该模型在 HTML 转 Markdown 任务上表现优于 Qwen2.5-32B-Instruct 和 Gemini2-flash-expr,而运行成本仅为其一小部分。

方法

该模型的有效性来自两项关键创新。首先,三阶段数据合成流水线通过迭代地起草、精炼和批评网页内容抽取来生成高质量、多样化的训练数据——这种合成数据方法确保模型无需人工标注即可见到各种 HTML 结构。其次,统一训练框架将连续预训练与多目标优化相结合,使模型能够同时学习 HTML 转 Markdown 和 HTML 转 JSON 转换。'浅而宽'(shallow-but-wide)的解码器专属架构(28 层、1536 隐藏维度、12 个查询头、2 个 KV 头)针对选择性复制操作进行了优化。512K token 上下文通过 zigzag-ring-attention 实现。对比损失训练显著减少了退化问题。

性能

在 HTML 转 Markdown 任务上,该模型取得 ROUGE-L 0.84、Jaro-Winkler 0.82、Levenshtein 距离 0.22,超过 Qwen2.5-32B-Instruct 和 Gemini2-flash-expr。在 HTML 转 JSON 任务上,它以 F1 分数 0.81、98% 通过率保持有竞争力的表现。在 T4 GPU 上,该模型以输入 67 tokens/s、输出 36 tokens/s 的速度处理。退化问题(token 循环、重复输出)通过对比损失训练显著减少。512K token 上下文窗口消除了大多数实际文档的分块需求。

最佳实践

该模型可通过 Google Colab 笔记本访问,其中演示了 HTML 转 Markdown、JSON 提取和指令遵循。对于 HTML 转 Markdown 任务,直接输入原始 HTML,无需前缀指令。对于 JSON 提取,在提示中指定目标模式。create_prompt 辅助函数便于为两种任务创建提示。该模型可在 Colab 免费 T4 GPU 层级运行(需要 vllm 和 triton),但不支持 bfloat16 或 Flash Attention 2 时存在限制;生产环境建议使用 RTX 3090/4090。可通过 AWS SageMaker、Azure 和 GCP 市场获取。以 CC BY-NC 4.0 许可用于非商业用途。将此模型作为 RAG 流水线中的预处理步骤,在使用 jina-embeddings-v5-text-small 嵌入之前将网页内容转换为干净的 Markdown。

提及此模型的博客
五月 25, 2025 • 21 分钟阅读
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
五月 07, 2025 • 9 分钟阅读
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
四月 08, 2025 • 21 分钟阅读
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
一月 31, 2025 • 14 分钟阅读
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
一月 15, 2025 • 17 分钟阅读
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 标志
open_in_new
下载 Elastic 标志
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业使用,不面向消费者。