Aperçu
reader-lm-1.5b est un petit modèle de langage de 1,54B paramètres qui convertit des documents HTML complexes en Markdown propre, surpassant des modèles 50× plus volumineux dont GPT-4 et Gemini-1.5-Pro sur la conversion HTML-vers-Markdown. Il traite des documents jusqu'à 256K tokens de manière native, éliminant le besoin d'opérations de chunking coûteuses. L'architecture « shallow-but-wide » du modèle est optimisée pour les opérations de copie sélective, atteignant une haute précision sans la surcharge computationnelle des LLMs à usage général.
Méthodes
Le modèle emploie une architecture decoder-only « shallow-but-wide » : 28 couches transformer, 12 têtes de requête et 2 têtes clé-valeur (GQA), 1536 dimensions cachées et 8960 dimensions intermédiaires. Cette configuration défie le savoir conventionnel selon lequel les modèles plus profonds sont toujours meilleurs — pour des tâches de copie sélective comme HTML-vers-Markdown, la largeur (plus de paramètres par couche) est plus efficace que la profondeur (plus de couches). L'entraînement a suivi deux étapes : (1) HTML court et simple (32K tokens) pour les schémas de conversion de base, (2) HTML long et difficile (128K tokens) pour la complexité du monde réel. Le mécanisme de zigzag-ring-attention permet le traitement de 256K tokens. La recherche contrastive et la détection de répétition préviennent les pathologies courantes des petits LM comme la dégénérescence et les boucles de tokens.
Performance
Le modèle atteint ROUGE-L de 0,72 et Token Error Rate de 0,19, surpassant nettement GPT-4 (0,43 ROUGE-L, 0,50 TER) et Gemini-1.5-Pro (0,42 ROUGE-L, 0,48 TER) sur la conversion HTML-vers-Markdown. Des évaluations qualitatives sur quatre dimensions clés — extraction d'en-têtes, extraction du contenu principal, préservation de structure riche et usage de la syntaxe Markdown — montrent une précision élevée et constante à travers divers types de documents : articles de presse, billets de blog, pages d'atterrissage et messages de forums. Le modèle traite plusieurs langues, dont l'anglais, l'allemand, le japonais et le chinois. Cette performance est obtenue en traitant des documents jusqu'à 256K tokens, éliminant l'overhead de chunking que les modèles plus grands nécessitent typiquement.
Conseils
Utilisez ce modèle pour le traitement de documents HTML complexes où la précision et l'efficacité priment. Les performances optimales requièrent une infrastructure GPU compatible CUDA, mais il s'exécute sur un matériel plus modeste que les LLMs à usage général. Disponible via AWS SageMaker et Azure Marketplace. Le modèle est spécifiquement optimisé pour la conversion HTML-vers-Markdown et n'est pas adapté à la génération de texte à usage général ou à d'autres tâches NLP. Lors du traitement de documents extrêmement longs (approchant 512K tokens), la performance peut se dégrader car cela dépasse la plage d'entraînement du modèle (256K). Implémentez les mécanismes de détection de répétition fournis et envisagez d'utiliser la recherche contrastive pendant l'inférence pour maintenir la qualité de la sortie. Pour l'extraction JSON aux côtés du Markdown, utilisez ReaderLM-v2, qui prend en charge l'optimisation multi-objectifs.


