Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Reader
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

reader-lm-0.5b

Un piccolo modello linguistico per convertire HTML grezzo in markdown
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2024-08-11
Ingresso
abc
Testo (HTML)
arrow_forward
Produzione
abc
Testo (Markdown)
Dettagli del modello
Parametri: 494M
Lunghezza del token di input: 256K
Modello base help_outline
open_in_new
Qwen2-0.5B-Instruct
Lingue addestrate help_outline
2 lingue
Lingue supportate help_outline
29 lingue
Modelli correlati
link
reader-lm-1.5b
Disponibile tramite
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O

HTML

reader-lm

Riduzione dei prezzi

Frontiera di Paretohelp_outline
Reader-LM v1 HTML-to-Markdown
Reader-LM v1 HTML-to-Markdown · TER
chevron_leftchevron_right
1B3.0B10B30B100B0.20.30.40.50.60.7llama-3.1-70bQwen2-7B-Instructreader-lm-1.5breader-lm-0.5bParametri (log)ROUGE-L
Questo modello
Sulla frontiera
Jina AI
Altri
Reader-LM v1 HTML-to-Markdown
0.560
Parametri
494M
Classifica per punteggio
2 / 4
Frontiera di Pareto
Sulla
Scegli i modelli da confrontare

Panoramica

Reader LM 0.5B è un modello di linguaggio specializzato progettato per risolvere la complessa sfida di convertire documenti HTML in testo markdown pulito e strutturato. Questo modello risponde a un'esigenza critica nelle moderne pipeline di elaborazione dati: trasformare in modo efficiente contenuti Web disordinati in un formato ideale per LLM e sistemi di documentazione. A differenza dei modelli di linguaggio generici che richiedono enormi risorse di calcolo, Reader LM 0.5B raggiunge un'elaborazione HTML di livello professionale con soli 494 milioni di parametri, rendendolo accessibile a team con risorse di calcolo limitate. Le organizzazioni che si occupano di elaborazione di contenuti Web, automazione della documentazione o creazione di applicazioni basate su LLM troveranno questo modello particolarmente prezioso per semplificare i flussi di lavoro di preparazione dei contenuti.

Metodi

Il modello impiega un'innovativa architettura "shallow-but-wide" specificamente ottimizzata per operazioni di copia selettiva piuttosto che per la generazione di testo creativo. Costruito su una base di decoder-only con 24 livelli e 896 dimensioni nascoste, il modello utilizza meccanismi di attenzione specializzati con 14 query head e 2 key-value head per elaborare in modo efficiente le sequenze di input. Il processo di addestramento ha coinvolto due fasi distinte: prima con HTML più breve e semplice (token da 32K) per apprendere modelli di conversione di base, poi con HTML complesso e reale (token da 128K) per gestire casi difficili. Il modello incorpora la ricerca contrastiva durante l'addestramento e implementa un meccanismo di rilevamento della ripetizione per prevenire problemi di degenerazione come i token loop. Un aspetto unico della sua architettura è il meccanismo di attenzione a zigzag-ring, che consente al modello di gestire sequenze estremamente lunghe fino a 256K token mantenendo prestazioni stabili.

Prestazione

Nei test nel mondo reale, Reader LM 0.5B dimostra impressionanti rapporti efficienza-prestazioni su più parametri. Il modello raggiunge un punteggio ROUGE-L di 0,56, che indica una forte conservazione dei contenuti, e mantiene un basso tasso di errore token di 0,34, mostrando un'allucinazione minima. Nelle valutazioni qualitative su 22 diverse fonti HTML, tra cui articoli di notizie, post di blog e pagine di e-commerce in più lingue, mostra una particolare forza nella conservazione della struttura e nell'uso della sintassi markdown. Il modello eccelle nella gestione di complesse pagine web moderne in cui CSS e script in linea possono espandersi fino a centinaia di migliaia di token, uno scenario in cui gli approcci tradizionali basati su regole spesso falliscono. Tuttavia, è importante notare che mentre il modello funziona eccezionalmente bene su semplici attività di conversione da HTML a markdown, potrebbe richiedere un'elaborazione aggiuntiva per pagine altamente dinamiche o con JavaScript pesante.

Orientamento

Per distribuire efficacemente Reader LM 0.5B, le organizzazioni devono assicurarsi che la propria infrastruttura possa gestire i requisiti CUDA del modello, sebbene la sua architettura efficiente implichi che possa essere eseguito su GPU di livello consumer. Il modello funziona meglio con input HTML raw e non richiede prefissi o istruzioni speciali. Per prestazioni ottimali, implementare il meccanismo di rilevamento delle ripetizioni fornito per prevenire potenziali loop di token nella generazione di output. Sebbene il modello supporti più linguaggi e varie strutture HTML, è specificamente progettato per l'estrazione di contenuti e la conversione di markdown: non deve essere utilizzato per attività come la generazione di testo, la sintesi o la risposta diretta alle domande. Il modello è disponibile tramite AWS SageMaker per la distribuzione in produzione e viene fornito un notebook Google Colab per test e sperimentazione. I team devono essere consapevoli che, sebbene il modello possa gestire documenti estremamente lunghi fino a 256K token, l'elaborazione di input così grandi potrebbe richiedere strategie di gestione della memoria aggiuntive.
Blog che menzionano questo modello
gennaio 15, 2025 • 17 minuti letti
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
settembre 11, 2024 • 13 minuti letti
Reader-LM: Small Language Models for Cleaning and Converting HTML to Markdown
Reader-LM-0.5B and Reader-LM-1.5B are two novel small language models inspired by Jina Reader, designed to convert raw, noisy HTML from the open web into clean markdown.
Jina AI
Technical screenshot displaying "REAPER-LM-0.5B/1.5B" with HTML source code for Jina's search grounding feature.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.