Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Reader
copyright CC BY-NC 4.0
open_in_new Post di rilascio

ReaderLM-v2

Un piccolo modello linguistico per convertire HTML grezzo in markdown o JSON
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2025-01-16
Ingresso
abc
Testo (HTML)
arrow_forward
Produzione
abc
Testo (Markdown)
abc
Testo (JSON)
Dettagli del modello
Parametri: 1.54B
Lunghezza del token di input: 512K
Modello base help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Lingue addestrate help_outline
14 lingue
Lingue supportate help_outline
29 lingue
Modelli correlati
link
reader-lm-1.5b
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Grafico I/O 1

HTML

ReaderLM-v2

Markdown

Grafico I/O 2

HTML

ReaderLM-v2

Istruzioni

JSON

Grafico I/O 3

HTML

ReaderLM-v2

Istruzioni

Markdown

Scegli i modelli da confrontare
Pubblicazioni (1)
ICLR 2025
marzo 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Panoramica

ReaderLM-v2 è un modello di linguaggio compatto da 1,54B di parametri che trasforma HTML disordinato in Markdown o JSON pulito con alta precisione, elaborando documenti fino a 512K token. Lo strumento ideale per il grounding dei LLM: convertire il contenuto web in formati strutturati. Supera Qwen2.5-32B-Instruct e Gemini2-flash-expr in HTML in Markdown — a una frazione del costo.

Metodi

L'efficacia del modello deriva da due innovazioni chiave. In primo luogo, un pipeline di sintesi dei dati in tre fasi genera dati di addestramento di alta qualità e diversificati redigendo, rifinando e criticando in modo iterativo l'estrazione di contenuti web — questo approccio sintetico garantisce che il modello veda una vasta varietà di strutture HTML senza richiedere annotazione manuale. In secondo luogo, un framework di addestramento unificato combina il pre-addestramento continuo con l'ottimizzazione multi-obiettivo, consentendo al modello di imparare simultaneamente la conversione da HTML a Markdown e da HTML a JSON. L'architettura 'shallow-but-wide' solo decodificatore (28 layer, 1536 dimensioni nascoste, 12 query head, 2 KV head) è ottimizzata per le operazioni di copia selettiva. Il contesto di 512K token è reso possibile dal zigzag-ring-attention. L'addestramento con perdita contrastiva riduce significativamente i problemi di degenerazione.

Prestazione

HTML in Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — supera Qwen2.5-32B-Instruct e Gemini2-flash-expr. HTML in JSON: F1 0,81, 98% di pass rate. 67 token/s input, 36 token/s output su T4. Degenerazione (loop di token) notevolmente ridotta. 512K elimina il chunking per la maggior parte dei documenti reali.

Orientamento

Il modello è accessibile tramite un notebook Google Colab che dimostra la conversione da HTML a Markdown, l'estrazione JSON e l'instruction-following. Per i task da HTML a Markdown, inserire HTML grezzo senza istruzioni di prefisso. Per l'estrazione JSON, specificare lo schema target nel prompt. La funzione helper create_prompt facilita la creazione di prompt per entrambi i task. Il modello funziona sul livello gratuito T4 GPU di Colab (richiede vllm e triton) ma ha limiti senza supporto bfloat16 o Flash Attention 2; per la produzione è consigliata la RTX 3090/4090. Disponibile su AWS SageMaker, Azure e marketplace GCP. Concesso in licenza sotto CC BY-NC 4.0 per uso non commerciale. Usare questo modello come passo di pre-elaborazione nei pipeline RAG per convertire i contenuti web in Markdown pulito prima dell'embedding con jina-embeddings-v5-text-small.

Blog che menzionano questo modello
maggio 25, 2025 • 21 minuti letti
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
maggio 07, 2025 • 9 minuti letti
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
aprile 08, 2025 • 21 minuti letti
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
gennaio 31, 2025 • 14 minuti letti
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
gennaio 15, 2025 • 17 minuti letti
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.