Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Reader
Convierta cualquier URL a Markdown para un mejor anclaje de los LLM.
Embeddings
Embeddings multimodales y multilingües.
Reranker
Reranker para maximizar la relevancia de los resultados de búsqueda.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Reader
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

ReaderLM-v2

Un pequeño modelo de lenguaje para convertir HTML sin formato en Markdown o JSON
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2025-01-16
Entrada
abc
Texto (HTML)
arrow_forward
Producción
abc
Texto (Markdown)
abc
Texto (JSON)
Detalles del modelo
Parámetros: 1.54B
Longitud del token de entrada: 512K
Modelo base help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Idiomas entrenados help_outline
14 idiomas
Idiomas admitidos help_outline
29 idiomas
Modelos relacionados
link
reader-lm-1.5b
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Nube de Google
Hugging Face
Air-gapped
Gráfico de E/S 1

HTML

ReaderLM-v2

Markdown

Gráfico de E/S 2

HTML

ReaderLM-v2

Instrucción

JSON

Gráfico de E/S 3

HTML

ReaderLM-v2

Instrucción

Markdown

Elija modelos para comparar
Publicaciones (1)
ICLR 2025
marzo 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Descripción general

ReaderLM-v2 es un modelo de lenguaje pequeño de 1,54B de parámetros que transforma HTML desordenado en Markdown o JSON limpio con alta precisión, procesando documentos hasta 512K tokens. La herramienta ideal para grounding de LLM: convertir contenido web en formatos estructurados. Supera a Qwen2.5-32B-Instruct y Gemini2-flash-expr en HTML-a-Markdown — a una fracción del costo.

Métodos

La eficacia del modelo se debe a dos innovaciones clave. En primer lugar, un pipeline de síntesis de datos de tres etapas genera datos de entrenamiento de alta calidad y diversos mediante el borrador, la refinación y la crítica iterativos de la extracción de contenido web: este enfoque de datos sintéticos asegura que el modelo vea una amplia variedad de estructuras HTML sin necesidad de anotación manual. En segundo lugar, un marco de entrenamiento unificado combina el preentrenamiento continuo con la optimización multiobjetivo, lo que permite al modelo aprender simultáneamente la conversión de HTML a Markdown y de HTML a JSON. La arquitectura solo decodificadora 'shallow-but-wide' (28 capas, 1536 dimensiones ocultas, 12 cabezas de consulta y 2 cabezas KV) está optimizada para operaciones de copia selectiva. El contexto de 512K tokens se habilita mediante zigzag-ring-attention. El entrenamiento con pérdida contrastiva reduce significativamente los problemas de degeneración.

Rendimiento

HTML-a-Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — supera a Qwen2.5-32B-Instruct y Gemini2-flash-expr. HTML-a-JSON: F1 0,81, 98% de tasa de aprobación. 67 tokens/s entrada, 36 tokens/s salida en T4. Degradación (bucles de tokens) reducida significativamente. 512K elimina el chunking para la mayoría de documentos reales.

Guía

El modelo está accesible a través de un cuaderno de Google Colab que demuestra la conversión de HTML a Markdown, la extracción de JSON y el seguimiento de instrucciones. Para tareas de HTML a Markdown, ingrese HTML sin procesar sin instrucciones de prefijo. Para la extracción de JSON, especifique el esquema objetivo en el prompt. La función auxiliar create_prompt facilita la creación de prompts para ambas tareas. El modelo funciona en la capa gratuita de GPU T4 de Colab (requiere vllm y triton) pero tiene limitaciones sin soporte de bfloat16 o Flash Attention 2; para producción se recomienda RTX 3090/4090. Disponible en AWS SageMaker, Azure y el mercado de GCP. Con licencia CC BY-NC 4.0 para uso no comercial. Use este modelo como paso de preprocesamiento en pipelines de RAG para convertir el contenido web en Markdown limpio antes de crear embeddings con jina-embeddings-v5-text-small.

Blogs que mencionan este modelo
mayo 25, 2025 • 21 minutos de lectura
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
mayo 07, 2025 • 9 minutos de lectura
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
abril 08, 2025 • 21 minutos de lectura
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
enero 31, 2025 • 14 minutos de lectura
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
enero 15, 2025 • 17 minutos de lectura
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Idioma / tema actual
Search Foundation
Reader
Embeddings
Reranker
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y su contenido, software, productos y servicios asociados están destinados exclusivamente a un uso profesional. El uso por parte de consumidores no está previsto ni dirigido.