Обзор
ReaderLM-v2 — компактная языковая модель на 1,54B параметров, превращающая хаотичный HTML в чистый Markdown или JSON с высокой точностью. Обработка документов до 512K токенов. Идеальный инструмент для граундинга LLM: конвертация веб-контента в структурированные форматы. Превышает Qwen2.5-32B-Instruct и Gemini2-flash-expr в конвертации HTML в Markdown — за малую долю стоимости.
Методы
Эффективность модели обусловлена двумя ключевыми новшествами. Во-первых, трёхстадийный конвейер синтеза данных генерирует качественные и разнообразные обучающие данные, итеративно составляя, уточняя и критикуя извлечение веб-контента — этот подход на синтетических данных обеспечивает модель широким разнообразием HTML-структур без ручной разметки. Во-вторых, единый фреймворк обучения сочетает непрерывное предобучение с мультицелевой оптимизацией, позволяя модели одновременно обучаться конвертации HTML в Markdown и HTML в JSON. «Широкая и неглубокая» (shallow-but-wide) архитектура только декодирования (28 слоёв, 1536 скрытых измерений, 12 query-голов, 2 KV-головы) оптимизирована для операций выборочного копирования. Контекст в 512K токенов обеспечивается zigzag-ring-attention. Обучение с контрастивной потерей существенно снижает проблемы деградации.
Производительность
HTML в Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — превышает Qwen2.5-32B-Instruct и Gemini2-flash-expr. HTML в JSON: F1 0,81, успешность 98 %. 67 токенов/с на входе, 36 токенов/с на выходе на T4. Дегенерация (циклы токенов) значительно снижена. 512K устраняет чанкинг для большинства реальных документов.
Руководство
Модель доступна через ноутбук Google Colab, демонстрирующий конвертацию HTML в Markdown, извлечение JSON и следование инструкциям. Для задач «HTML в Markdown» вводите сырой HTML без префиксных инструкций. Для извлечения JSON укажите целевую схему в промпте. Вспомогательная функция create_prompt упрощает создание промптов для обеих задач. Модель работает на бесплатном уровне T4 GPU в Colab (требуется vllm и triton), но без поддержки bfloat16 или Flash Attention 2 имеет ограничения; для продакшена рекомендуется RTX 3090/4090. Доступна в AWS SageMaker, Azure и маркетплейсе GCP. Лицензия CC BY-NC 4.0 для некоммерческого использования. Используйте эту модель как этап предобработки в RAG-конвейерах: конвертируйте веб-контент в чистый Markdown перед эмбеддингом с помощью jina-embeddings-v5-text-small.









