概述
reader-lm-1.5b 是一個 1.54B 參數的小型語言模型,將複雜的 HTML 文件轉換為乾淨的 Markdown,在 HTML 到 Markdown 轉換上超越了 50 倍於其大小的模型,包括 GPT-4 和 Gemini-1.5-Pro。它原生處理多達 256K token 的文件,消除了對昂貴分塊操作的需求。該模型的 'shallow-but-wide' 架構為選擇性複製操作而最佳化,在不承擔通用 LLM 計算開銷的情況下實現高準確率。
方法
該模型採用 'shallow-but-wide' decoder-only 架構:28 個 transformer 層、12 個 query 頭和 2 個 key-value 頭(GQA)、1536 隱藏維度和 8960 中間維度。這一配置挑戰了「更深的模型總是更好」的傳統認知——對於 HTML 到 Markdown 這類選擇性複製任務,寬度(每層更多參數)比深度(更多層)更有效。訓練分兩個階段:(1) 短而簡單的 HTML(32K token)用於基本轉換模式,(2) 長而困難的 HTML(128K token)用於真實世界的複雜性。zigzag-ring-attention 機制實現 256K token 處理。對比搜尋和重複偵測防止小 LM 的常見病理性問題,如退化和 token 迴圈。
效能
該模型取得 ROUGE-L 0.72 和 Token Error Rate 0.19,在 HTML 到 Markdown 轉換上顯著超越 GPT-4(ROUGE-L 0.43,TER 0.50)和 Gemini-1.5-Pro(ROUGE-L 0.42,TER 0.48)。在四個關鍵維度——標題提取、主內容提取、富結構保留、Markdown 語法使用——上的定性評估顯示,在新聞文章、部落格文章、著陸頁和論壇貼文等多樣化文件類型上始終保持高準確率。該模型處理包括英文、德文、日文和中文在內的多種語言。這一效能是在處理多達 256K token 的文件時實現,消除了更大模型通常所需的分塊開銷。
最佳實踐
對於以準確率和效率為首要目標的複雜 HTML 文件處理,請使用該模型。最佳效能需要支援 CUDA 的 GPU 基礎設施,但它執行在比通用 LLM 要求更低的硬體上。可透過 AWS SageMaker 和 Azure Marketplace 取得。該模型專門為 HTML 到 Markdown 轉換最佳化,不適合通用文字產生或其他 NLP 任務。處理極長文件(接近 512K token)時,由於超出模型的訓練範圍(256K),效能可能會下降。請實現提供的重複偵測機制,並考慮在推論期間使用對比搜尋以維持輸出品質。為了與 Markdown 並行的 JSON 提取,請使用支援多目標最佳化的 ReaderLM-v2。


