Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Читатель
copyright CC BY-NC 4.0
open_in_new Выпуск Пост

ReaderLM-v2

Небольшая языковая модель для преобразования сырого HTML в markdown или JSON
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2025-01-16
Вход
abc
Текст (HTML)
arrow_forward
Выход
abc
Текст (разметка)
abc
Текст (JSON)
Подробности модели
Параметры: 1.54B
Длина входного токена: 512K
Базовая модель help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Обученные языки help_outline
14 языки
Поддерживаемые языки help_outline
29 языки
Похожие модели
link
reader-lm-1.5b
Доступно через
API Джина
AWS SageMaker
Microsoft Azure
Google Облако
Hugging Face
Air-gapped
График ввода-вывода 1

HTML

ReaderLM-v2

Маркдаун

График ввода-вывода 2

HTML

ReaderLM-v2

Инструкция

JSON

График ввода-вывода 3

HTML

ReaderLM-v2

Инструкция

Маркдаун

Pareto fronthelp_outline
ReaderLM-v2 HTML-to-Markdown · html2mdmain
ReaderLM-v2 HTML-to-Markdown · html2mdmain · ins
chevron_leftchevron_right
3.0B10B30B13001400150016001700Qwen2.5-32B-Instructreader-lm-1.5bReaderLM-v2Parameters (log)Damerau
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
Выберите модели для сравнения
Публикации (1)
ICLR 2025
март 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Обзор

ReaderLM-v2 — это языковая модель с 1,5 млрд параметров, которая преобразует необработанный HTML в markdown или JSON, обрабатывая до 512 тыс. токенов общей длины ввода/вывода с поддержкой 29 языков. В отличие от своего предшественника, который рассматривал HTML-в-markdown как задачу «выборочного копирования», v2 рассматривает его как процесс перевода, обеспечивая превосходную обработку сложных элементов, таких как кодовые ограждения, вложенные списки, таблицы и уравнения LaTeX. Модель поддерживает постоянную производительность при различной длине контекста и вводит возможности прямой генерации HTML-в-JSON с предопределенными схемами.

Методы

Обучение ReaderLM-v2, основанное на Qwen2.5-1.5B-Instruction, включало набор данных html-markdown-1m из десяти миллионов HTML-документов, в среднем по 56 000 токенов каждый. Процесс обучения включал: 1) предварительное обучение на длинном контексте с использованием ring-zag attention и RoPE для расширения контекста с 32K до 256K токенов, 2) контролируемую тонкую настройку с уточненными наборами данных, 3) прямую оптимизацию предпочтений для выравнивания выходных данных и 4) настройку с подкреплением в режиме self-play. Подготовка данных следовала трехэтапному конвейеру (Draft-Refine-Critique) на базе Qwen2.5-32B-Instruction, со специализированными моделями, обученными для определенных задач перед слиянием с помощью линейной интерполяции параметров.

Производительность

В комплексных тестах ReaderLM-v2 превосходит более крупные модели, такие как Qwen2.5-32B-Instruct и Gemini2-flash-expr, в задачах HTML-to-Markdown. Для извлечения основного контента он достигает ROUGE-L 0,84, Jaro-Winkler 0,82 и значительно меньшего расстояния Левенштейна (0,22) по сравнению с конкурентами. В задачах HTML-to-JSON он сохраняет конкурентоспособную производительность с оценкой F1 0,81 и долей успешных прохождений 98%. Модель обрабатывает 67 токенов/с на входе и 36 токенов/с на выходе на GPU T4, со значительно уменьшенными проблемами вырождения за счет обучения с контрастными потерями.

Руководство

Модель доступна через блокнот Google Colab, демонстрирующий преобразование HTML в Markdown, извлечение JSON и выполнение инструкций. Для задач HTML в Markdown пользователи могут вводить необработанный HTML без префиксных инструкций, тогда как извлечение JSON требует определенного форматирования схемы. Вспомогательная функция create_prompt упрощает создание подсказок для обеих задач. Хотя модель работает на бесплатном уровне графического процессора T4 Colab (требуется vllm и triton), она имеет ограничения без поддержки bfloat16 или flash attention 2. Для использования в производстве рекомендуется RTX 3090/4090. Модель будет доступна на AWS SageMaker, Azure и GCP marketplace по лицензии CC BY-NC 4.0 для некоммерческого использования.
Блоги, в которых упоминается эта модель
май 25, 2025 • 21 минуты чтения
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
май 07, 2025 • 9 минуты чтения
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
апрель 08, 2025 • 21 минуты чтения
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
январь 31, 2025 • 14 минуты чтения
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
январь 15, 2025 • 17 минуты чтения
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.