Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
warning
Questo modello è obsoleto nei modelli più recenti.
Acquisizione dati
copyright CC BY-NC 4.0
open_in_new Post di rilascio

reader-lm-1.5b

Un piccolo modello linguistico per convertire HTML grezzo in markdown
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2024-08-11
Ingresso
abc
Testo (HTML)
arrow_forward
Produzione
abc
Testo (Markdown)
Dettagli del modello
Parametri: 1.54B
Lunghezza del token di input: 256K
Modello base help_outline
open_in_new
Qwen2-1.5B-Instruct
Lingue addestrate help_outline
2 lingue
Lingue supportate help_outline
29 lingue
Modelli correlati
link
reader-lm-0.5b
Disponibile tramite
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Grafico I/O

HTML

reader-lm

Markdown

Scegli i modelli da confrontare

Panoramica

reader-lm-1.5b è un piccolo modello di linguaggio da 1,54B parametri che converte documenti HTML complessi in Markdown pulito, superando modelli 50× più grandi tra cui GPT-4 e Gemini-1.5-Pro nella conversione da HTML a Markdown. Gestisce documenti fino a 256K token in modo nativo, eliminando la necessità di operazioni di chunking costose. L'architettura 'shallow-but-wide' del modello è ottimizzata per operazioni di copia selettiva, raggiungendo alta accuratezza senza l'overhead computazionale dei LLM a scopo generico.

Metodi

Il modello adotta un'architettura decoder-only 'shallow-but-wide': 28 layer transformer, 12 query head e 2 key-value head (GQA), 1536 dimensioni nascoste e 8960 dimensioni intermedie. Questa configurazione mette in discussione il senso comune secondo cui i modelli più profondi sono sempre migliori — per task di copia selettiva come la conversione da HTML a Markdown, l'ampiezza (più parametri per layer) è più efficace della profondità (più layer). L'addestramento ha seguito due fasi: (1) HTML corto e semplice (32K token) per pattern di conversione di base, (2) HTML lungo e difficile (128K token) per complessità del mondo reale. Il meccanismo di zigzag-ring-attention abilita l'elaborazione di 256K token. La ricerca contrastiva e il rilevamento delle ripetizioni prevengono le patologie comuni dei piccoli LM come degenerazione e loop di token.

Prestazione

Il modello raggiunge ROUGE-L di 0,72 e Token Error Rate di 0,19, superando significativamente GPT-4 (0,43 ROUGE-L, 0,50 TER) e Gemini-1.5-Pro (0,42 ROUGE-L, 0,48 TER) nella conversione da HTML a Markdown. Valutazioni qualitative su quattro dimensioni chiave — estrazione degli header, estrazione del contenuto principale, preservazione della struttura ricca e uso della sintassi Markdown — mostrano un'alta accuratezza costante su diversi tipi di documento: articoli di notizie, post di blog, landing page e post di forum. Il modello gestisce più lingue, tra cui inglese, tedesco, giapponese e cinese. Questa performance è ottenuta mentre si elaborano documenti fino a 256K token, eliminando l'overhead di chunking che i modelli più grandi tipicamente richiedono.

Orientamento

Usa questo modello per l'elaborazione di documenti HTML complessi dove accuratezza ed efficienza sono primarie. Le prestazioni ottimali richiedono infrastruttura GPU con supporto CUDA, ma gira su hardware più modesto dei LLM a scopo generico. Disponibile tramite AWS SageMaker e Azure Marketplace. Il modello è specificamente ottimizzato per la conversione da HTML a Markdown e non è adatto alla generazione di testo a scopo generico o ad altri task NLP. Quando si elaborano documenti estremamente lunghi (avvicinandosi a 512K token), le prestazioni possono degradarsi poiché questo supera il range di addestramento del modello (256K). Implementa i meccanismi di rilevamento delle ripetizioni forniti e valuta l'uso della ricerca contrastiva durante l'inferenza per mantenere la qualità dell'output. Per l'estrazione JSON accanto al Markdown, usa ReaderLM-v2, che supporta l'ottimizzazione multi-obiettivo.

Blog che menzionano questo modello
gennaio 15, 2025 • 17 minuti letti
ReaderLM v2: Modello linguistico di frontiera di piccole dimensioni per HTML verso Markdown e JSON
ReaderLM-v2 è un piccolo modello linguistico da 1.5B per la conversione da HTML a Markdown e l'estrazione da HTML a JSON con precisione eccezionale.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
settembre 11, 2024 • 13 minuti letti
Reader-LM: Piccoli Language Model per Pulire e Convertire HTML in Markdown
Reader-LM-0.5B e Reader-LM-1.5B sono due nuovi piccoli language model ispirati a Jina Reader, progettati per convertire l'HTML grezzo e confuso del web pubblico in markdown pulito.
Jina AI
Technical screenshot displaying "REAPER-LM-0.5B/1.5B" with HTML source code for Jina's search grounding feature.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.