Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Lecteur
copyright CC BY-NC 4.0
open_in_new Publication de publication

ReaderLM-v2

Un petit modèle de langage pour convertir du HTML brut en Markdown ou JSON
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2025-01-16
Saisir
abc
Texte (HTML)
arrow_forward
Sortir
abc
Texte (Markdown)
abc
Texte (JSON)
Détails du modèle
Paramètres: 1.54B
Longueur du jeton d'entrée: 512K
Modèle de base help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Langues enseignées help_outline
14 langues
Langues prises en charge help_outline
29 langues
Modèles associés
link
reader-lm-1.5b
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Graphique d'E/S 1

HTML

ReaderLM-v2

Réduction

Graphique d'E/S 2

HTML

ReaderLM-v2

Instruction

JSON

Graphique d'E/S 3

HTML

ReaderLM-v2

Instruction

Réduction

Pareto fronthelp_outline
ReaderLM-v2 HTML-to-Markdown · html2mdmain
ReaderLM-v2 HTML-to-Markdown · html2mdmain · ins
chevron_leftchevron_right
3.0B10B30B13001400150016001700Qwen2.5-32B-Instructreader-lm-1.5bReaderLM-v2Parameters (log)Damerau
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
Choisissez les modèles à comparer
Publications (1)
ICLR 2025
mars 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Aperçu

ReaderLM-v2 est un modèle de langage de 1,5 milliard de paramètres qui convertit le HTML brut en Markdown ou JSON, gérant jusqu'à 512 000 jetons de longueur d'entrée/sortie combinée avec prise en charge de 29 langues. Contrairement à son prédécesseur qui traitait la conversion HTML vers Markdown comme une tâche de « copie sélective », la version 2 l'aborde comme un processus de traduction, permettant une gestion supérieure des éléments complexes tels que les clôtures de code, les listes imbriquées, les tableaux et les équations LaTeX. Le modèle maintient des performances cohérentes sur différentes longueurs de contexte et introduit des capacités de génération directe de HTML vers JSON avec des schémas prédéfinis.

Méthodes

Construit sur Qwen2.5-1.5B-Instruction, l'entraînement de ReaderLM-v2 s'est appuyé sur un ensemble de données HTML-Markdown-1m de dix millions de documents HTML, contenant en moyenne 56 000 jetons chacun. Le processus d'entraînement comprenait : 1) un pré-entraînement contextuel long utilisant l'attention en anneau et RoPE pour étendre le contexte de 32 000 à 256 000 jetons ; 2) un réglage fin supervisé avec des ensembles de données affinés ; 3) une optimisation directe des préférences pour l'alignement des résultats ; et 4) un réglage par renforcement automatique. La préparation des données a suivi un pipeline en trois étapes (Draft-Refine-Critique) optimisé par Qwen2.5-32B-Instruction, avec des modèles spécialisés entraînés pour des tâches spécifiques avant fusion par interpolation linéaire des paramètres.

Performance

Dans des tests comparatifs complets, ReaderLM-v2 surpasse des modèles plus grands comme Qwen2.5-32B-Instruct et Gemini2-flash-expr sur les tâches HTML vers Markdown. Pour l'extraction du contenu principal, il atteint un ROUGE-L de 0,84, un Jaro-Winkler de 0,82 et une distance de Levenshtein nettement inférieure (0,22) par rapport à ses concurrents. Dans les tâches HTML vers JSON, il maintient des performances compétitives avec des scores F1 de 0,81 et un taux de réussite de 98 %. Le modèle traite à 67 jetons/s en entrée et 36 jetons/s en sortie sur un GPU T4, avec des problèmes de dégénérescence considérablement réduits grâce à un entraînement par perte contrastive.

Conseils

Le modèle est accessible via un bloc-notes Google Colab illustrant la conversion HTML vers Markdown, l'extraction JSON et le suivi des instructions. Pour les tâches HTML vers Markdown, les utilisateurs peuvent saisir du code HTML brut sans instructions de préfixe, tandis que l'extraction JSON nécessite un formatage de schéma spécifique. La fonction d'assistance create_prompt facilite la création d'invites pour les deux tâches. Bien que le modèle fonctionne sur le niveau GPU T4 gratuit de Colab (nécessitant vllm et triton), il présente des limitations sans prise en charge de bfloat16 ou de Flash Attention 2. RTX 3090/4090 est recommandé pour une utilisation en production. Le modèle sera disponible sur AWS SageMaker, Azure et GCP Marketplace, sous licence CC BY-NC 4.0 pour une utilisation non commerciale.
Blogs qui mentionnent ce modèle
mai 25, 2025 • 21 minutes lues
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
mai 07, 2025 • 9 minutes lues
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
avril 08, 2025 • 21 minutes lues
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
janvier 31, 2025 • 14 minutes lues
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
janvier 15, 2025 • 17 minutes lues
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.