Panoramica
ReaderLM-v2 è un modello di linguaggio compatto da 1,54B di parametri che trasforma HTML disordinato in Markdown o JSON pulito con alta precisione, elaborando documenti fino a 512K token. Lo strumento ideale per il grounding dei LLM: convertire il contenuto web in formati strutturati. Supera Qwen2.5-32B-Instruct e Gemini2-flash-expr in HTML in Markdown — a una frazione del costo.
Metodi
L'efficacia del modello deriva da due innovazioni chiave. In primo luogo, un pipeline di sintesi dei dati in tre fasi genera dati di addestramento di alta qualità e diversificati redigendo, rifinando e criticando in modo iterativo l'estrazione di contenuti web — questo approccio sintetico garantisce che il modello veda una vasta varietà di strutture HTML senza richiedere annotazione manuale. In secondo luogo, un framework di addestramento unificato combina il pre-addestramento continuo con l'ottimizzazione multi-obiettivo, consentendo al modello di imparare simultaneamente la conversione da HTML a Markdown e da HTML a JSON. L'architettura 'shallow-but-wide' solo decodificatore (28 layer, 1536 dimensioni nascoste, 12 query head, 2 KV head) è ottimizzata per le operazioni di copia selettiva. Il contesto di 512K token è reso possibile dal zigzag-ring-attention. L'addestramento con perdita contrastiva riduce significativamente i problemi di degenerazione.
Prestazione
HTML in Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — supera Qwen2.5-32B-Instruct e Gemini2-flash-expr. HTML in JSON: F1 0,81, 98% di pass rate. 67 token/s input, 36 token/s output su T4. Degenerazione (loop di token) notevolmente ridotta. 512K elimina il chunking per la maggior parte dei documenti reali.
Orientamento
Il modello è accessibile tramite un notebook Google Colab che dimostra la conversione da HTML a Markdown, l'estrazione JSON e l'instruction-following. Per i task da HTML a Markdown, inserire HTML grezzo senza istruzioni di prefisso. Per l'estrazione JSON, specificare lo schema target nel prompt. La funzione helper create_prompt facilita la creazione di prompt per entrambi i task. Il modello funziona sul livello gratuito T4 GPU di Colab (richiede vllm e triton) ma ha limiti senza supporto bfloat16 o Flash Attention 2; per la produzione è consigliata la RTX 3090/4090. Disponibile su AWS SageMaker, Azure e marketplace GCP. Concesso in licenza sotto CC BY-NC 4.0 per uso non commerciale. Usare questo modello come passo di pre-elaborazione nei pipeline RAG per convertire i contenuti web in Markdown pulito prima dell'embedding con jina-embeddings-v5-text-small.









