Panoramica
reader-lm-1.5b è un piccolo modello di linguaggio da 1,54B parametri che converte documenti HTML complessi in Markdown pulito, superando modelli 50× più grandi tra cui GPT-4 e Gemini-1.5-Pro nella conversione da HTML a Markdown. Gestisce documenti fino a 256K token in modo nativo, eliminando la necessità di operazioni di chunking costose. L'architettura 'shallow-but-wide' del modello è ottimizzata per operazioni di copia selettiva, raggiungendo alta accuratezza senza l'overhead computazionale dei LLM a scopo generico.
Metodi
Il modello adotta un'architettura decoder-only 'shallow-but-wide': 28 layer transformer, 12 query head e 2 key-value head (GQA), 1536 dimensioni nascoste e 8960 dimensioni intermedie. Questa configurazione mette in discussione il senso comune secondo cui i modelli più profondi sono sempre migliori — per task di copia selettiva come la conversione da HTML a Markdown, l'ampiezza (più parametri per layer) è più efficace della profondità (più layer). L'addestramento ha seguito due fasi: (1) HTML corto e semplice (32K token) per pattern di conversione di base, (2) HTML lungo e difficile (128K token) per complessità del mondo reale. Il meccanismo di zigzag-ring-attention abilita l'elaborazione di 256K token. La ricerca contrastiva e il rilevamento delle ripetizioni prevengono le patologie comuni dei piccoli LM come degenerazione e loop di token.
Prestazione
Il modello raggiunge ROUGE-L di 0,72 e Token Error Rate di 0,19, superando significativamente GPT-4 (0,43 ROUGE-L, 0,50 TER) e Gemini-1.5-Pro (0,42 ROUGE-L, 0,48 TER) nella conversione da HTML a Markdown. Valutazioni qualitative su quattro dimensioni chiave — estrazione degli header, estrazione del contenuto principale, preservazione della struttura ricca e uso della sintassi Markdown — mostrano un'alta accuratezza costante su diversi tipi di documento: articoli di notizie, post di blog, landing page e post di forum. Il modello gestisce più lingue, tra cui inglese, tedesco, giapponese e cinese. Questa performance è ottenuta mentre si elaborano documenti fino a 256K token, eliminando l'overhead di chunking che i modelli più grandi tipicamente richiedono.
Orientamento
Usa questo modello per l'elaborazione di documenti HTML complessi dove accuratezza ed efficienza sono primarie. Le prestazioni ottimali richiedono infrastruttura GPU con supporto CUDA, ma gira su hardware più modesto dei LLM a scopo generico. Disponibile tramite AWS SageMaker e Azure Marketplace. Il modello è specificamente ottimizzato per la conversione da HTML a Markdown e non è adatto alla generazione di testo a scopo generico o ad altri task NLP. Quando si elaborano documenti estremamente lunghi (avvicinandosi a 512K token), le prestazioni possono degradarsi poiché questo supera il range di addestramento del modello (256K). Implementa i meccanismi di rilevamento delle ripetizioni forniti e valuta l'uso della ricerca contrastiva durante l'inferenza per mantenere la qualità dell'output. Per l'estrazione JSON accanto al Markdown, usa ReaderLM-v2, che supporta l'ottimizzazione multi-obiettivo.


