Graphique d'E/S 1
Graphique d'E/S 2
Graphique d'E/S 3
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
Choisissez les modèles à comparer
Publications (1)
Aperçu
ReaderLM-v2 est un modèle de langage de 1,5 milliard de paramètres qui convertit le HTML brut en Markdown ou JSON, gérant jusqu'à 512 000 jetons de longueur d'entrée/sortie combinée avec prise en charge de 29 langues. Contrairement à son prédécesseur qui traitait la conversion HTML vers Markdown comme une tâche de « copie sélective », la version 2 l'aborde comme un processus de traduction, permettant une gestion supérieure des éléments complexes tels que les clôtures de code, les listes imbriquées, les tableaux et les équations LaTeX. Le modèle maintient des performances cohérentes sur différentes longueurs de contexte et introduit des capacités de génération directe de HTML vers JSON avec des schémas prédéfinis.
Méthodes
Construit sur Qwen2.5-1.5B-Instruction, l'entraînement de ReaderLM-v2 s'est appuyé sur un ensemble de données HTML-Markdown-1m de dix millions de documents HTML, contenant en moyenne 56 000 jetons chacun. Le processus d'entraînement comprenait : 1) un pré-entraînement contextuel long utilisant l'attention en anneau et RoPE pour étendre le contexte de 32 000 à 256 000 jetons ; 2) un réglage fin supervisé avec des ensembles de données affinés ; 3) une optimisation directe des préférences pour l'alignement des résultats ; et 4) un réglage par renforcement automatique. La préparation des données a suivi un pipeline en trois étapes (Draft-Refine-Critique) optimisé par Qwen2.5-32B-Instruction, avec des modèles spécialisés entraînés pour des tâches spécifiques avant fusion par interpolation linéaire des paramètres.
Performance
Dans des tests comparatifs complets, ReaderLM-v2 surpasse des modèles plus grands comme Qwen2.5-32B-Instruct et Gemini2-flash-expr sur les tâches HTML vers Markdown. Pour l'extraction du contenu principal, il atteint un ROUGE-L de 0,84, un Jaro-Winkler de 0,82 et une distance de Levenshtein nettement inférieure (0,22) par rapport à ses concurrents. Dans les tâches HTML vers JSON, il maintient des performances compétitives avec des scores F1 de 0,81 et un taux de réussite de 98 %. Le modèle traite à 67 jetons/s en entrée et 36 jetons/s en sortie sur un GPU T4, avec des problèmes de dégénérescence considérablement réduits grâce à un entraînement par perte contrastive.
Conseils
Le modèle est accessible via un bloc-notes Google Colab illustrant la conversion HTML vers Markdown, l'extraction JSON et le suivi des instructions. Pour les tâches HTML vers Markdown, les utilisateurs peuvent saisir du code HTML brut sans instructions de préfixe, tandis que l'extraction JSON nécessite un formatage de schéma spécifique. La fonction d'assistance create_prompt facilite la création d'invites pour les deux tâches. Bien que le modèle fonctionne sur le niveau GPU T4 gratuit de Colab (nécessitant vllm et triton), il présente des limitations sans prise en charge de bfloat16 ou de Flash Attention 2. RTX 3090/4090 est recommandé pour une utilisation en production. Le modèle sera disponible sur AWS SageMaker, Azure et GCP Marketplace, sous licence CC BY-NC 4.0 pour une utilisation non commerciale.
Blogs qui mentionnent ce modèle









