Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Lector
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

ReaderLM-v2

Un pequeño modelo de lenguaje para convertir HTML sin formato en Markdown o JSON
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2025-01-16
Aporte
abc
Texto (HTML)
arrow_forward
Producción
abc
Texto (Markdown)
abc
Texto (JSON)
Detalles del modelo
Parámetros: 1.54B
Longitud del token de entrada: 512K
Modelo base help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Idiomas entrenados help_outline
14 idiomas
Idiomas admitidos help_outline
29 idiomas
Modelos relacionados
link
reader-lm-1.5b
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Nube de Google
Hugging Face
Air-gapped
Gráfico de E/S 1

HTML

ReaderLM-v2

Reducción

Gráfico de E/S 2

HTML

ReaderLM-v2

Instrucción

JSON

Gráfico de E/S 3

HTML

ReaderLM-v2

Instrucción

Reducción

Pareto fronthelp_outline
ReaderLM-v2 HTML-to-Markdown · html2mdmain
ReaderLM-v2 HTML-to-Markdown · html2mdmain · ins
chevron_leftchevron_right
3.0B10B30B13001400150016001700Qwen2.5-32B-Instructreader-lm-1.5bReaderLM-v2Parameters (log)Damerau
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
Elige modelos para comparar
Publicaciones (1)
ICLR 2025
marzo 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Descripción general

ReaderLM-v2 es un modelo de lenguaje de parámetros 1.5B que convierte HTML sin formato en Markdown o JSON, manejando hasta 512K tokens de longitud de entrada/salida combinada con soporte para 29 idiomas. A diferencia de su predecesor que trataba la conversión de HTML a Markdown como una tarea de "copia selectiva", v2 lo aborda como un proceso de traducción, lo que permite un manejo superior de elementos complejos como cercas de código, listas anidadas, tablas y ecuaciones LaTeX. El modelo mantiene un rendimiento consistente en diferentes longitudes de contexto e introduce capacidades de generación directa de HTML a JSON con esquemas predefinidos.

Métodos

Basado en Qwen2.5-1.5B-Instruction, el entrenamiento de ReaderLM-v2 implicó un conjunto de datos html-markdown-1m de diez millones de documentos HTML, con un promedio de 56 000 tokens cada uno. El proceso de entrenamiento incluyó: 1) preentrenamiento de contexto largo mediante atención ring-zag y RoPE para expandir el contexto de 32 000 a 256 000 tokens; 2) ajuste fino supervisado con conjuntos de datos refinados; 3) optimización directa de preferencias para la alineación de salida; y 4) ajuste de refuerzo de auto-reproducción. La preparación de los datos siguió un proceso de tres pasos (Borrador-Refinamiento-Crítica) impulsado por Qwen2.5-32B-Instruction, con modelos especializados entrenados para tareas específicas antes de su fusión mediante interpolación lineal de parámetros.

Actuación

En pruebas comparativas exhaustivas, ReaderLM-v2 supera a modelos más grandes como Qwen2.5-32B-Instruct y Gemini2-flash-expr en tareas de conversión de HTML a Markdown. Para la extracción de contenido principal, logra un ROUGE-L de 0,84, un Jaro-Winkler de 0,82 y una distancia de Levenshtein significativamente menor (0,22) en comparación con los competidores. En tareas de conversión de HTML a JSON, mantiene un rendimiento competitivo con puntajes F1 de 0,81 y una tasa de aprobación del 98 %. El modelo procesa a 67 tokens/s de entrada y 36 tokens/s de salida en una GPU T4, con problemas de degeneración significativamente reducidos a través del entrenamiento de pérdida de contraste.

Guía

Se puede acceder al modelo a través de un notebook de Google Colab que muestra la conversión de HTML a Markdown, la extracción de JSON y el seguimiento de instrucciones. Para las tareas de HTML a Markdown, los usuarios pueden ingresar HTML sin instrucciones de prefijo, mientras que la extracción de JSON requiere un formato de esquema específico. La función auxiliar create_prompt facilita la creación de indicaciones para ambas tareas. Si bien el modelo funciona en el nivel de GPU T4 gratuito de Colab (que requiere vllm y triton), tiene limitaciones sin compatibilidad con bfloat16 o Flash Attention 2. Se recomienda RTX 3090/4090 para uso en producción. El modelo estará disponible en AWS SageMaker, Azure y GCP Marketplace, con licencia CC BY-NC 4.0 para uso no comercial.
Blogs que mencionan este modelo
mayo 25, 2025 • 21 minutos de lectura
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
mayo 07, 2025 • 9 minutos de lectura
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
abril 08, 2025 • 21 minutos de lectura
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
enero 31, 2025 • 14 minutos de lectura
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
enero 15, 2025 • 17 minutos de lectura
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.