График ввода-вывода 1
График ввода-вывода 2
График ввода-вывода 3
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
Выберите модели для сравнения
Публикации (1)
Обзор
ReaderLM-v2 — это языковая модель с 1,5 млрд параметров, которая преобразует необработанный HTML в markdown или JSON, обрабатывая до 512 тыс. токенов общей длины ввода/вывода с поддержкой 29 языков. В отличие от своего предшественника, который рассматривал HTML-в-markdown как задачу «выборочного копирования», v2 рассматривает его как процесс перевода, обеспечивая превосходную обработку сложных элементов, таких как кодовые ограждения, вложенные списки, таблицы и уравнения LaTeX. Модель поддерживает постоянную производительность при различной длине контекста и вводит возможности прямой генерации HTML-в-JSON с предопределенными схемами.
Методы
Обучение ReaderLM-v2, основанное на Qwen2.5-1.5B-Instruction, включало набор данных html-markdown-1m из десяти миллионов HTML-документов, в среднем по 56 000 токенов каждый. Процесс обучения включал: 1) предварительное обучение на длинном контексте с использованием ring-zag attention и RoPE для расширения контекста с 32K до 256K токенов, 2) контролируемую тонкую настройку с уточненными наборами данных, 3) прямую оптимизацию предпочтений для выравнивания выходных данных и 4) настройку с подкреплением в режиме self-play. Подготовка данных следовала трехэтапному конвейеру (Draft-Refine-Critique) на базе Qwen2.5-32B-Instruction, со специализированными моделями, обученными для определенных задач перед слиянием с помощью линейной интерполяции параметров.
Производительность
В комплексных тестах ReaderLM-v2 превосходит более крупные модели, такие как Qwen2.5-32B-Instruct и Gemini2-flash-expr, в задачах HTML-to-Markdown. Для извлечения основного контента он достигает ROUGE-L 0,84, Jaro-Winkler 0,82 и значительно меньшего расстояния Левенштейна (0,22) по сравнению с конкурентами. В задачах HTML-to-JSON он сохраняет конкурентоспособную производительность с оценкой F1 0,81 и долей успешных прохождений 98%. Модель обрабатывает 67 токенов/с на входе и 36 токенов/с на выходе на GPU T4, со значительно уменьшенными проблемами вырождения за счет обучения с контрастными потерями.
Руководство
Модель доступна через блокнот Google Colab, демонстрирующий преобразование HTML в Markdown, извлечение JSON и выполнение инструкций. Для задач HTML в Markdown пользователи могут вводить необработанный HTML без префиксных инструкций, тогда как извлечение JSON требует определенного форматирования схемы. Вспомогательная функция create_prompt упрощает создание подсказок для обеих задач. Хотя модель работает на бесплатном уровне графического процессора T4 Colab (требуется vllm и triton), она имеет ограничения без поддержки bfloat16 или flash attention 2. Для использования в производстве рекомендуется RTX 3090/4090. Модель будет доступна на AWS SageMaker, Azure и GCP marketplace по лицензии CC BY-NC 4.0 для некоммерческого использования.
Блоги, в которых упоминается эта модель









