Aperçu
ReaderLM-v2 est un petit modèle de langage de 1,54B paramètres qui transforme le HTML désordonné en Markdown ou JSON propre avec une grande précision, traitant des documents jusqu'à 512K tokens. L'outil idéal pour le grounding des LLM : convertir le contenu web en formats structurés. Surpasse Qwen2.5-32B-Instruct et Gemini2-flash-expr en HTML vers Markdown — à une fraction du coût.
Méthodes
L'efficacité du modèle résulte de deux innovations clés. D'abord, un pipeline de synthèse de données en trois étapes génère des données d'entraînement de haute qualité et diversifiées en ébauchant, affinant et critiquant itérativement l'extraction de contenu web — cette approche par données synthétiques garantit que le modèle voit une grande variété de structures HTML sans annotation manuelle. Ensuite, un cadre d'entraînement unifié combine le pré-entraînement continu avec l'optimisation multi-objectifs, permettant au modèle d'apprendre simultanément la conversion HTML-vers-Markdown et HTML-vers-JSON. L'architecture « shallow-but-wide » à décodage uniquement (28 couches, 1536 dimensions cachées, 12 têtes de requête, 2 têtes KV), est optimisée pour les opérations de copie sélective. Le contexte de 512K tokens est rendu possible par le zigzag-ring-attention. L'entraînement avec perte contrastive réduit significativement les problèmes de dégénérescence.
Performance
HTML vers Markdown : ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — surpasse Qwen2.5-32B-Instruct et Gemini2-flash-expr. HTML vers JSON : F1 0,81, 98% de réussite. 67 tokens/s en entrée, 36 tokens/s en sortie sur T4. Dégradation (boucles de tokens) nettement réduite. 512K élimine le chunking pour la plupart des documents réels.
Conseils
Le modèle est accessible via un notebook Google Colab démontrant la conversion HTML-vers-Markdown, l'extraction JSON et le suivi d'instructions. Pour les tâches HTML-vers-Markdown, saisissez du HTML brut sans préfixes d'instruction. Pour l'extraction JSON, spécifiez le schéma cible dans le prompt. La fonction d'aide create_prompt facilite la création de prompts pour les deux tâches. Le modèle fonctionne sur le palier gratuit T4 GPU de Colab (nécessite vllm et triton) mais a des limites sans support bfloat16 ou Flash Attention 2 ; pour la production, RTX 3090/4090 est recommandé. Disponible sur AWS SageMaker, Azure et le marketplace GCP. Licencié sous CC BY-NC 4.0 pour un usage non commercial. Utilisez ce modèle comme étape de prétraitement dans les pipelines RAG pour convertir le contenu web en Markdown propre avant l'embedding avec jina-embeddings-v5-text-small.









