Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент реранжирования для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
warning
Эта модель устарела из-за появления новых моделей.
Reader
copyright CC BY-NC 4.0
open_in_new Выпуск Пост

reader-lm-0.5b

Небольшая языковая модель для преобразования сырого HTML в разметку
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2024-08-11
Вход
abc
Текст (HTML)
arrow_forward
Выход
abc
Текст (Markdown)
Подробности модели
Параметры: 494M
Длина входного токена: 256K
Базовая модель help_outline
open_in_new
Qwen2-0.5B-Instruct
Обученные языки help_outline
2 языки
Поддерживаемые языки help_outline
29 языки
Похожие модели
link
reader-lm-1.5b
Доступно через
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
График ввода-вывода

HTML

reader-lm

Маркдаун

Парето-фронтhelp_outline
Reader-LM v1 HTML-to-Markdown
Reader-LM v1 HTML-to-Markdown · TER
chevron_leftchevron_right
1B3.0B10B30B100B0.20.30.40.50.60.7llama-3.1-70bQwen2-7B-Instructreader-lm-1.5breader-lm-0.5bПараметры (лог)ROUGE-L
Эта модель
На фронте
Jina AI
Другие
Reader-LM v1 HTML-to-Markdown
0.560
Параметры
494M
Ранг по баллу
2 / 4
Парето-фронт
На фронте
Выберите модели для сравнения

Обзор

Reader LM 0.5B — это специализированная языковая модель, разработанная для решения сложной задачи преобразования HTML-документов в чистый, структурированный текст markdown. Эта модель решает критическую потребность в современных конвейерах обработки данных: эффективное преобразование беспорядочного веб-контента в формат, который идеально подходит для LLM и систем документирования. В отличие от универсальных языковых моделей, требующих огромных вычислительных ресурсов, Reader LM 0.5B достигает обработки HTML профессионального уровня всего с 494 млн параметров, что делает ее доступной для групп с ограниченными вычислительными ресурсами. Организации, занимающиеся обработкой веб-контента, автоматизацией документации или созданием приложений на базе LLM, найдут эту модель особенно ценной для оптимизации рабочих процессов подготовки контента.

Методы

Модель использует инновационную архитектуру «неглубокая, но широкая», специально оптимизированную для операций выборочного копирования, а не для творческой генерации текста. Созданная на основе только декодера с 24 слоями и 896 скрытыми измерениями, модель использует специализированные механизмы внимания с 14 головками запросов и 2 головками ключ-значение для эффективной обработки входных последовательностей. Процесс обучения включал два отдельных этапа: сначала с более коротким, более простым HTML (32K токенов) для изучения основных шаблонов преобразования, затем со сложным, реальным HTML (128K токенов) для обработки сложных случаев. Модель включает в себя контрастный поиск во время обучения и реализует механизм обнаружения повторений для предотвращения проблем вырождения, таких как циклы токенов. Уникальным аспектом ее архитектуры является механизм зигзагообразного кольца-внимания, который позволяет модели обрабатывать чрезвычайно длинные последовательности до 256K токенов, сохраняя при этом стабильную производительность.

Производительность

В реальных тестах Reader LM 0.5B демонстрирует впечатляющие соотношения эффективности и производительности по нескольким показателям. Модель достигает оценки ROUGE-L 0,56, что указывает на надежное сохранение контента, и поддерживает низкий уровень ошибок токенов 0,34, показывая минимальную галлюцинацию. В качественных оценках по 22 различным источникам HTML, включая новостные статьи, записи в блогах и страницы электронной коммерции на нескольких языках, она показывает особую силу в сохранении структуры и использовании синтаксиса markdown. Модель отлично справляется с обработкой сложных современных веб-страниц, где встроенные CSS и скрипты могут расширяться до сотен тысяч токенов — сценарий, в котором традиционные подходы на основе правил часто терпят неудачу. Однако важно отметить, что, хотя модель исключительно хорошо выполняет простые задачи преобразования HTML в markdown, для высокодинамичных или насыщенных JavaScript страниц может потребоваться дополнительная обработка.

Руководство

Для эффективного развертывания Reader LM 0.5B организации должны убедиться, что их инфраструктура может справиться с требованиями модели CUDA, хотя ее эффективная архитектура означает, что она может работать на графических процессорах потребительского уровня. Модель лучше всего работает с необработанным вводом HTML и не требует специальных префиксов или инструкций. Для оптимальной производительности реализуйте предоставленный механизм обнаружения повторений, чтобы предотвратить потенциальные циклы токенов при генерации выходных данных. Хотя модель поддерживает несколько языков и различные структуры HTML, она специально разработана для извлечения контента и преобразования в разметку — ее не следует использовать для таких задач, как генерация текста, реферирование или прямые ответы на вопросы. Модель доступна через AWS SageMaker для развертывания в рабочей среде, а для тестирования и экспериментов предоставляется блокнот Google Colab. Команды должны знать, что, хотя модель может обрабатывать чрезвычайно длинные документы размером до 256 тыс. токенов, обработка таких больших входных данных может потребовать дополнительных стратегий управления памятью.
Блоги, в которых упоминается эта модель
январь 15, 2025 • 17 минуты чтения
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
сентябрь 11, 2024 • 13 минуты чтения
Reader-LM: Small Language Models for Cleaning and Converting HTML to Markdown
Reader-LM-0.5B and Reader-LM-1.5B are two novel small language models inspired by Jina Reader, designed to convert raw, noisy HTML from the open web into clean markdown.
Jina AI
Technical screenshot displaying "REAPER-LM-0.5B/1.5B" with HTML source code for Jina's search grounding feature.
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.