I/O 圖
帕累託前緣help_outline
chevron_leftchevron_right
本模型
在前緣上
Jina AI
其他
Reader-LM v1 HTML-to-Markdown
0.560
參數量
494M
按分數的排名
2 / 4
帕累託前緣
在前緣上
選擇要比較的模型
概述
Reader LM 0.5B 是一款專用語言模型,用於攻克把 HTML 文件轉換為乾淨、結構化 Markdown 文本這一難題。它滿足了現代資料處理流程中的一項關鍵需求:高效地把雜亂的網頁內容整理成適合大模型和文件系統使用的格式。通用語言模型往往需要大量算力,而 Reader LM 0.5B 僅用 4.94 億參數就能完成專業級的 HTML 處理,算力有限的團隊也能輕鬆用上。需要處理網頁內容、實現文件自動化或構建大模型應用的團隊,會發現它能大幅簡化內容準備流程。
方法
該模型採用創新的「淺而寬」架構,專為選擇性複製而非創意文字生成而最佳化。它以純解碼器為基礎,含 24 層、896 維隱藏層,注意力機制配置為 14 個查詢頭和 2 個鍵值頭,可高效處理輸入序列。訓練分兩個階段:先用較短、較簡單的 HTML(32K 詞元)學習基本轉換規律,再用複雜的真實 HTML(128K 詞元)應對疑難場景。訓練中引入對比搜尋,並加入重複檢測機制,避免出現詞元迴圈之類的退化問題。架構上的一大特色是鋸齒環形注意力機制,讓模型能穩定處理長達 256K 詞元的超長序列。
效能
在實際測試中,Reader LM 0.5B 在多個指標上都展現出出色的價效比。ROUGE-L 得分 0.56,說明內容保留完整;詞元錯誤率低至 0.34,幾乎不產生幻覺。在涵蓋多語言新聞、部落格和電商頁面的 22 個 HTML 來源上做定性評估,它在結構保留和 Markdown 語法運用方面表現突出。面對內聯 CSS 和指令碼動輒膨脹到數十萬詞元的複雜現代網頁,傳統規則方法往往失效,而該模型應對自如。不過需要說明的是,它在常規的 HTML 轉 Markdown 任務上表現極佳,但對於高度動態或重度依賴 JavaScript 的頁面,可能還需要額外處理。
最佳實踐
要有效部署 Reader LM 0.5B,需確保基礎設施滿足模型的 CUDA 要求;不過得益於高效的架構,它也能在消費級 GPU 上執行。該模型直接接受原始 HTML 輸入,無需特殊字首或指令。為獲得最佳效果,請啟用官方提供的重複檢測機制,避免輸出生成時出現詞元迴圈。模型雖然支援多種語言和各類 HTML 結構,但專為內容提取和 markdown 轉換設計,不適合文字生成、摘要或直接問答等任務。生產部署可透過 AWS SageMaker,此外還提供 Google Colab notebook 供測試和試驗。需要注意的是,模型雖可處理長達 256K 詞元的超長文件,但處理這類超大輸入可能需要額外的記憶體管理策略。
提及此模型的部落格


