Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reranker
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
warning
Ce modèle est obsolète pour les modèles plus récents.
Ingestion de données
copyright CC BY-NC 4.0
open_in_new Article de lancement

reader-lm-1.5b

Un petit modèle de langage pour convertir du HTML brut en Markdown
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2024-08-11
Saisie
abc
Texte (HTML)
arrow_forward
Sortir
abc
Texte (Markdown)
Détails du modèle
Paramètres: 1.54B
Longueur du token d'entrée: 256K
Modèle de base help_outline
open_in_new
Qwen2-1.5B-Instruct
Langues enseignées help_outline
2 langues
Langues prises en charge help_outline
29 langues
Modèles associés
link
reader-lm-0.5b
Disponible via
AWS SageMaker
Microsoft Azure
Hugging Face
Air-gapped
Graphique d'E/S

HTML

reader-lm

Markdown

Choisissez les modèles à comparer

Aperçu

reader-lm-1.5b est un petit modèle de langage de 1,54B paramètres qui convertit des documents HTML complexes en Markdown propre, surpassant des modèles 50× plus volumineux dont GPT-4 et Gemini-1.5-Pro sur la conversion HTML-vers-Markdown. Il traite des documents jusqu'à 256K tokens de manière native, éliminant le besoin d'opérations de chunking coûteuses. L'architecture « shallow-but-wide » du modèle est optimisée pour les opérations de copie sélective, atteignant une haute précision sans la surcharge computationnelle des LLMs à usage général.

Méthodes

Le modèle emploie une architecture decoder-only « shallow-but-wide » : 28 couches transformer, 12 têtes de requête et 2 têtes clé-valeur (GQA), 1536 dimensions cachées et 8960 dimensions intermédiaires. Cette configuration défie le savoir conventionnel selon lequel les modèles plus profonds sont toujours meilleurs — pour des tâches de copie sélective comme HTML-vers-Markdown, la largeur (plus de paramètres par couche) est plus efficace que la profondeur (plus de couches). L'entraînement a suivi deux étapes : (1) HTML court et simple (32K tokens) pour les schémas de conversion de base, (2) HTML long et difficile (128K tokens) pour la complexité du monde réel. Le mécanisme de zigzag-ring-attention permet le traitement de 256K tokens. La recherche contrastive et la détection de répétition préviennent les pathologies courantes des petits LM comme la dégénérescence et les boucles de tokens.

Performance

Le modèle atteint ROUGE-L de 0,72 et Token Error Rate de 0,19, surpassant nettement GPT-4 (0,43 ROUGE-L, 0,50 TER) et Gemini-1.5-Pro (0,42 ROUGE-L, 0,48 TER) sur la conversion HTML-vers-Markdown. Des évaluations qualitatives sur quatre dimensions clés — extraction d'en-têtes, extraction du contenu principal, préservation de structure riche et usage de la syntaxe Markdown — montrent une précision élevée et constante à travers divers types de documents : articles de presse, billets de blog, pages d'atterrissage et messages de forums. Le modèle traite plusieurs langues, dont l'anglais, l'allemand, le japonais et le chinois. Cette performance est obtenue en traitant des documents jusqu'à 256K tokens, éliminant l'overhead de chunking que les modèles plus grands nécessitent typiquement.

Conseils

Utilisez ce modèle pour le traitement de documents HTML complexes où la précision et l'efficacité priment. Les performances optimales requièrent une infrastructure GPU compatible CUDA, mais il s'exécute sur un matériel plus modeste que les LLMs à usage général. Disponible via AWS SageMaker et Azure Marketplace. Le modèle est spécifiquement optimisé pour la conversion HTML-vers-Markdown et n'est pas adapté à la génération de texte à usage général ou à d'autres tâches NLP. Lors du traitement de documents extrêmement longs (approchant 512K tokens), la performance peut se dégrader car cela dépasse la plage d'entraînement du modèle (256K). Implémentez les mécanismes de détection de répétition fournis et envisagez d'utiliser la recherche contrastive pendant l'inférence pour maintenir la qualité de la sortie. Pour l'extraction JSON aux côtés du Markdown, utilisez ReaderLM-v2, qui prend en charge l'optimisation multi-objectifs.

Blogs qui mentionnent ce modèle
janvier 15, 2025 • 17 minutes lues
ReaderLM v2 : Un petit modèle de langage de pointe pour la conversion HTML vers Markdown et JSON
ReaderLM-v2 est un petit modèle de langage de 1,5B destiné à la conversion HTML-vers-Markdown et à l'extraction HTML-vers-JSON avec une précision exceptionnelle.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
septembre 11, 2024 • 13 minutes lues
Reader-LM : Petits modèles de langage pour nettoyer et convertir le HTML en Markdown
Reader-LM-0.5B et Reader-LM-1.5B sont deux nouveaux modèles de langage de petite taille inspirés par Jina Reader, conçus pour convertir le HTML brut et bruité du web ouvert en markdown propre.
Jina AI
Technical screenshot displaying "REAPER-LM-0.5B/1.5B" with HTML source code for Jina's search grounding feature.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reranker
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.