Descripción general
ReaderLM-v2 es un modelo de lenguaje pequeño de 1,54B de parámetros que transforma HTML desordenado en Markdown o JSON limpio con alta precisión, procesando documentos hasta 512K tokens. La herramienta ideal para grounding de LLM: convertir contenido web en formatos estructurados. Supera a Qwen2.5-32B-Instruct y Gemini2-flash-expr en HTML-a-Markdown — a una fracción del costo.
Métodos
La eficacia del modelo se debe a dos innovaciones clave. En primer lugar, un pipeline de síntesis de datos de tres etapas genera datos de entrenamiento de alta calidad y diversos mediante el borrador, la refinación y la crítica iterativos de la extracción de contenido web: este enfoque de datos sintéticos asegura que el modelo vea una amplia variedad de estructuras HTML sin necesidad de anotación manual. En segundo lugar, un marco de entrenamiento unificado combina el preentrenamiento continuo con la optimización multiobjetivo, lo que permite al modelo aprender simultáneamente la conversión de HTML a Markdown y de HTML a JSON. La arquitectura solo decodificadora 'shallow-but-wide' (28 capas, 1536 dimensiones ocultas, 12 cabezas de consulta y 2 cabezas KV) está optimizada para operaciones de copia selectiva. El contexto de 512K tokens se habilita mediante zigzag-ring-attention. El entrenamiento con pérdida contrastiva reduce significativamente los problemas de degeneración.
Rendimiento
HTML-a-Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — supera a Qwen2.5-32B-Instruct y Gemini2-flash-expr. HTML-a-JSON: F1 0,81, 98% de tasa de aprobación. 67 tokens/s entrada, 36 tokens/s salida en T4. Degradación (bucles de tokens) reducida significativamente. 512K elimina el chunking para la mayoría de documentos reales.
Guía
El modelo está accesible a través de un cuaderno de Google Colab que demuestra la conversión de HTML a Markdown, la extracción de JSON y el seguimiento de instrucciones. Para tareas de HTML a Markdown, ingrese HTML sin procesar sin instrucciones de prefijo. Para la extracción de JSON, especifique el esquema objetivo en el prompt. La función auxiliar create_prompt facilita la creación de prompts para ambas tareas. El modelo funciona en la capa gratuita de GPU T4 de Colab (requiere vllm y triton) pero tiene limitaciones sin soporte de bfloat16 o Flash Attention 2; para producción se recomienda RTX 3090/4090. Disponible en AWS SageMaker, Azure y el mercado de GCP. Con licencia CC BY-NC 4.0 para uso no comercial. Use este modelo como paso de preprocesamiento en pipelines de RAG para convertir el contenido web en Markdown limpio antes de crear embeddings con jina-embeddings-v5-text-small.









