Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Lettore
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

ReaderLM-v2

Un piccolo modello linguistico per convertire HTML grezzo in markdown o JSON
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2025-01-16
Ingresso
abc
Testo (HTML)
arrow_forward
Produzione
abc
Testo (Markdown)
abc
Testo (JSON)
Dettagli del modello
Parametri: 1.54B
Lunghezza del token di input: 512K
Modello base help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Lingue addestrate help_outline
14 lingue
Lingue supportate help_outline
29 lingue
Modelli correlati
link
reader-lm-1.5b
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Grafico I/O 1

HTML

ReaderLM-v2

Riduzione dei prezzi

Grafico I/O 2

HTML

ReaderLM-v2

Istruzioni

JSON

Grafico I/O 3

HTML

ReaderLM-v2

Istruzioni

Riduzione dei prezzi

Pareto fronthelp_outline
ReaderLM-v2 HTML-to-Markdown · html2mdmain
ReaderLM-v2 HTML-to-Markdown · html2mdmain · ins
chevron_leftchevron_right
3.0B10B30B13001400150016001700Qwen2.5-32B-Instructreader-lm-1.5bReaderLM-v2Parameters (log)Damerau
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
Scegli i modelli da confrontare
Pubblicazioni (1)
ICLR 2025
marzo 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Panoramica

ReaderLM-v2 è un modello di linguaggio con parametri da 1,5 miliardi che converte HTML grezzo in markdown o JSON, gestendo fino a 512K token di lunghezza input/output combinata con supporto per 29 lingue. A differenza del suo predecessore che trattava HTML-to-markdown come un'attività di "copia selettiva", v2 lo affronta come un processo di traduzione, consentendo una gestione superiore di elementi complessi come code fence, elenchi nidificati, tabelle ed equazioni LaTeX. Il modello mantiene prestazioni costanti su diverse lunghezze di contesto e introduce capacità di generazione diretta HTML-to-JSON con schemi predefiniti.

Metodi

Basato su Qwen2.5-1.5B-Instruction, l'addestramento di ReaderLM-v2 ha coinvolto un dataset html-markdown-1m di dieci milioni di documenti HTML, con una media di 56.000 token ciascuno. Il processo di addestramento includeva: 1) pre-addestramento a lungo contesto utilizzando l'attenzione ring-zag e RoPE per espandere il contesto da 32.000 a 256.000 token, 2) ottimizzazione supervisionata con dataset raffinati, 3) ottimizzazione diretta delle preferenze per l'allineamento dell'output e 4) ottimizzazione del rinforzo auto-riproduzione. La preparazione dei dati ha seguito una pipeline in tre fasi (Bozza-Affinamento-Critica) basata su Qwen2.5-32B-Instruction, con modelli specializzati addestrati per attività specifiche prima della fusione tramite interpolazione lineare dei parametri.

Prestazione

Nei benchmark completi, ReaderLM-v2 supera modelli più grandi come Qwen2.5-32B-Instruct e Gemini2-flash-expr su attività HTML-to-Markdown. Per l'estrazione del contenuto principale, ottiene ROUGE-L di 0,84, Jaro-Winkler di 0,82 e una distanza di Levenshtein significativamente inferiore (0,22) rispetto ai concorrenti. Nelle attività HTML-to-JSON, mantiene prestazioni competitive con punteggi F1 di 0,81 e un tasso di superamento del 98%. Il modello elabora a 67 token/s in input e 36 token/s in output su una GPU T4, con problemi di degenerazione significativamente ridotti tramite training di perdita contrastiva.

Orientamento

Il modello è accessibile tramite un notebook Google Colab che dimostra la conversione da HTML a markdown, l'estrazione JSON e il rispetto delle istruzioni. Per le attività da HTML a Markdown, gli utenti possono immettere HTML grezzo senza istruzioni di prefisso, mentre l'estrazione JSON richiede una formattazione di schema specifica. La funzione helper create_prompt facilita la creazione di prompt per entrambe le attività. Mentre il modello funziona sul livello GPU T4 gratuito di Colab (che richiede vllm e triton), presenta delle limitazioni senza il supporto bfloat16 o flash attention 2. RTX 3090/4090 è consigliato per l'uso in produzione. Il modello sarà disponibile su AWS SageMaker, Azure e GCP marketplace, con licenza CC BY-NC 4.0 per uso non commerciale.
Blog che menzionano questo modello
maggio 25, 2025 • 21 minuti letti
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
maggio 07, 2025 • 9 minuti letti
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
aprile 08, 2025 • 21 minuti letti
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
gennaio 31, 2025 • 14 minuti letti
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
gennaio 15, 2025 • 17 minuti letti
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.