График ввода-вывода 1

HTML

ReaderLM-v2

Markdown

График ввода-вывода 2

HTML

ReaderLM-v2

Инструкция

JSON

График ввода-вывода 3

HTML

ReaderLM-v2

Инструкция

Markdown

Выберите модели для сравнения
Публикации (1)

Обзор

ReaderLM-v2 — компактная языковая модель на 1,54B параметров, превращающая хаотичный HTML в чистый Markdown или JSON с высокой точностью. Обработка документов до 512K токенов. Идеальный инструмент для граундинга LLM: конвертация веб-контента в структурированные форматы. Превышает Qwen2.5-32B-Instruct и Gemini2-flash-expr в конвертации HTML в Markdown — за малую долю стоимости.

Методы

Эффективность модели обусловлена двумя ключевыми новшествами. Во-первых, трёхстадийный конвейер синтеза данных генерирует качественные и разнообразные обучающие данные, итеративно составляя, уточняя и критикуя извлечение веб-контента — этот подход на синтетических данных обеспечивает модель широким разнообразием HTML-структур без ручной разметки. Во-вторых, единый фреймворк обучения сочетает непрерывное предобучение с мультицелевой оптимизацией, позволяя модели одновременно обучаться конвертации HTML в Markdown и HTML в JSON. «Широкая и неглубокая» (shallow-but-wide) архитектура только декодирования (28 слоёв, 1536 скрытых измерений, 12 query-голов, 2 KV-головы) оптимизирована для операций выборочного копирования. Контекст в 512K токенов обеспечивается zigzag-ring-attention. Обучение с контрастивной потерей существенно снижает проблемы деградации.

Производительность

HTML в Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — превышает Qwen2.5-32B-Instruct и Gemini2-flash-expr. HTML в JSON: F1 0,81, успешность 98 %. 67 токенов/с на входе, 36 токенов/с на выходе на T4. Дегенерация (циклы токенов) значительно снижена. 512K устраняет чанкинг для большинства реальных документов.

Руководство

Модель доступна через ноутбук Google Colab, демонстрирующий конвертацию HTML в Markdown, извлечение JSON и следование инструкциям. Для задач «HTML в Markdown» вводите сырой HTML без префиксных инструкций. Для извлечения JSON укажите целевую схему в промпте. Вспомогательная функция create_prompt упрощает создание промптов для обеих задач. Модель работает на бесплатном уровне T4 GPU в Colab (требуется vllm и triton), но без поддержки bfloat16 или Flash Attention 2 имеет ограничения; для продакшена рекомендуется RTX 3090/4090. Доступна в AWS SageMaker, Azure и маркетплейсе GCP. Лицензия CC BY-NC 4.0 для некоммерческого использования. Используйте эту модель как этап предобработки в RAG-конвейерах: конвертируйте веб-контент в чистый Markdown перед эмбеддингом с помощью jina-embeddings-v5-text-small.

Блоги, в которых упоминается эта модель
май 25, 2025 • 21 минуты чтения
Что мы узнали на ICLR2025
Мы собрали несколько наиболее интересных статей на ICLR 2025, посвященных TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba и т. д.
май 07, 2025 • 9 минуты чтения
Рецепт "супа" моделей для эмбеддингов
Повысьте надежность и производительность с помощью model soups: усреднение весов. Никаких дополнительных затрат, лучшие результаты.
апрель 08, 2025 • 21 минуты чтения
jina-reranker-m0: Многоязычный мультимодальный ранжировщик документов
Представляем jina-reranker-m0, наш новый мультиязычный мультимодальный ранжировщик для поиска визуальных документов, демонстрирующий передовую производительность в задачах поиска многоязычных длинных документов и программного кода.
январь 31, 2025 • 14 минуты чтения
Практическое руководство по развертыванию фундаментальных моделей поиска в продакшене
Мы предоставляем подробную разбивку затрат и производительности для трех стратегий развертывания: Jina API, самостоятельно размещенный K8s и AWS SageMaker, чтобы помочь вам принять правильное решение.
январь 15, 2025 • 17 минуты чтения
ReaderLM v2: Передовая малая языковая модель для преобразования HTML в Markdown и JSON
ReaderLM-v2 — это небольшая языковая модель размером 1.5B, предназначенная для конвертации HTML в Markdown и извлечения данных из HTML в JSON с исключительной точностью.