Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Reader
copyright CC BY-NC 4.0
open_in_new Article de lancement

ReaderLM-v2

Un petit modèle de langage pour convertir du HTML brut en Markdown ou JSON
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2025-01-16
Saisie
abc
Texte (HTML)
arrow_forward
Sortir
abc
Texte (Markdown)
abc
Texte (JSON)
Détails du modèle
Paramètres: 1.54B
Longueur du token d'entrée: 512K
Modèle de base help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Langues enseignées help_outline
14 langues
Langues prises en charge help_outline
29 langues
Modèles associés
link
reader-lm-1.5b
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Graphique d'E/S 1

HTML

ReaderLM-v2

Markdown

Graphique d'E/S 2

HTML

ReaderLM-v2

Instruction

JSON

Graphique d'E/S 3

HTML

ReaderLM-v2

Instruction

Markdown

Choisissez les modèles à comparer
Publications (1)
ICLR 2025
mars 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Aperçu

ReaderLM-v2 est un petit modèle de langage de 1,54B paramètres qui transforme le HTML désordonné en Markdown ou JSON propre avec une grande précision, traitant des documents jusqu'à 512K tokens. L'outil idéal pour le grounding des LLM : convertir le contenu web en formats structurés. Surpasse Qwen2.5-32B-Instruct et Gemini2-flash-expr en HTML vers Markdown — à une fraction du coût.

Méthodes

L'efficacité du modèle résulte de deux innovations clés. D'abord, un pipeline de synthèse de données en trois étapes génère des données d'entraînement de haute qualité et diversifiées en ébauchant, affinant et critiquant itérativement l'extraction de contenu web — cette approche par données synthétiques garantit que le modèle voit une grande variété de structures HTML sans annotation manuelle. Ensuite, un cadre d'entraînement unifié combine le pré-entraînement continu avec l'optimisation multi-objectifs, permettant au modèle d'apprendre simultanément la conversion HTML-vers-Markdown et HTML-vers-JSON. L'architecture « shallow-but-wide » à décodage uniquement (28 couches, 1536 dimensions cachées, 12 têtes de requête, 2 têtes KV), est optimisée pour les opérations de copie sélective. Le contexte de 512K tokens est rendu possible par le zigzag-ring-attention. L'entraînement avec perte contrastive réduit significativement les problèmes de dégénérescence.

Performance

HTML vers Markdown : ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — surpasse Qwen2.5-32B-Instruct et Gemini2-flash-expr. HTML vers JSON : F1 0,81, 98% de réussite. 67 tokens/s en entrée, 36 tokens/s en sortie sur T4. Dégradation (boucles de tokens) nettement réduite. 512K élimine le chunking pour la plupart des documents réels.

Conseils

Le modèle est accessible via un notebook Google Colab démontrant la conversion HTML-vers-Markdown, l'extraction JSON et le suivi d'instructions. Pour les tâches HTML-vers-Markdown, saisissez du HTML brut sans préfixes d'instruction. Pour l'extraction JSON, spécifiez le schéma cible dans le prompt. La fonction d'aide create_prompt facilite la création de prompts pour les deux tâches. Le modèle fonctionne sur le palier gratuit T4 GPU de Colab (nécessite vllm et triton) mais a des limites sans support bfloat16 ou Flash Attention 2 ; pour la production, RTX 3090/4090 est recommandé. Disponible sur AWS SageMaker, Azure et le marketplace GCP. Licencié sous CC BY-NC 4.0 pour un usage non commercial. Utilisez ce modèle comme étape de prétraitement dans les pipelines RAG pour convertir le contenu web en Markdown propre avant l'embedding avec jina-embeddings-v5-text-small.

Blogs qui mentionnent ce modèle
mai 25, 2025 • 21 minutes lues
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
mai 07, 2025 • 9 minutes lues
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
avril 08, 2025 • 21 minutes lues
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
janvier 31, 2025 • 14 minutes lues
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
janvier 15, 2025 • 17 minutes lues
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.