Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Leser
copyright CC BY-NC 4.0
open_in_new Beitrag veröffentlichen

ReaderLM-v2

Ein kleines Sprachmodell zur Konvertierung von reinem HTML in Markdown oder JSON
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2025-01-16
Eingang
abc
Text (HTML)
arrow_forward
Ausgabe
abc
Text (Markdown)
abc
Text (JSON)
Modelldetails
Parameter: 1.54B
Länge des Eingabetokens: 512K
Basismodell help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Ausgebildete Sprachen help_outline
14 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Ähnliche Modelle
link
reader-lm-1.5b
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-Gapped
E/A-Diagramm 1

HTML

ReaderLM-v2

Preisnachlass

E/A-Diagramm 2

HTML

ReaderLM-v2

Anweisung

JSON

E/A-Diagramm 3

HTML

ReaderLM-v2

Anweisung

Preisnachlass

Pareto fronthelp_outline
ReaderLM-v2 HTML-to-Markdown · html2mdmain
ReaderLM-v2 HTML-to-Markdown · html2mdmain · ins
chevron_leftchevron_right
3.0B10B30B13001400150016001700Qwen2.5-32B-Instructreader-lm-1.5bReaderLM-v2Parameters (log)Damerau
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
ICLR 2025
März 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Überblick

ReaderLM-v2 ist ein 1,5-B-Parameter-Sprachmodell, das reines HTML in Markdown oder JSON konvertiert und bis zu 512.000 Tokens kombinierte Eingabe-/Ausgabelänge mit Unterstützung für 29 Sprachen verarbeitet. Anders als sein Vorgänger, der HTML-zu-Markdown als „selektives Kopieren“ behandelte, geht v2 es als Übersetzungsprozess an und ermöglicht so eine bessere Verarbeitung komplexer Elemente wie Codezäune, verschachtelte Listen, Tabellen und LaTeX-Gleichungen. Das Modell behält eine konsistente Leistung über verschiedene Kontextlängen hinweg bei und führt direkte HTML-zu-JSON-Generierungsfunktionen mit vordefinierten Schemata ein.

Methoden

ReaderLM-v2 basiert auf Qwen2.5-1.5B-Instruction; das Training umfasste einen html-markdown-1m-Datensatz mit zehn Millionen HTML-Dokumenten und durchschnittlich jeweils 56.000 Token. Der Trainingsprozess umfasste: 1) Langkontext-Vortraining mit Ring-Zag-Attention und RoPE zur Erweiterung des Kontexts von 32K auf 256K Token, 2) überwachtes Feintuning mit verfeinerten Datensätzen, 3) direkte Präferenzoptimierung zur Ausgabeausrichtung und 4) Self-Play-Verstärkungstuning. Die Datenaufbereitung erfolgte in einem dreistufigen Prozess (Draft-Refine-Critique) auf Basis von Qwen2.5-32B-Instruction, wobei spezialisierte Modelle für spezifische Aufgaben trainiert und anschließend mittels linearer Parameterinterpolation zusammengeführt wurden.

Leistung

In umfassenden Benchmarks übertrifft ReaderLM-v2 größere Modelle wie Qwen2.5-32B-Instruct und Gemini2-flash-expr bei HTML-zu-Markdown-Aufgaben. Bei der Extraktion von Hauptinhalten erreicht es einen ROUGE-L von 0,84, einen Jaro-Winkler von 0,82 und eine deutlich niedrigere Levenshtein-Distanz (0,22) im Vergleich zu Mitbewerbern. Bei HTML-zu-JSON-Aufgaben hält es mit F1-Ergebnissen von 0,81 und einer Erfolgsquote von 98 % eine konkurrenzfähige Leistung aufrecht. Das Modell verarbeitet 67 Token/s Eingabe und 36 Token/s Ausgabe auf einer T4-GPU, wobei die Degenerationsprobleme durch kontrastives Verlusttraining deutlich reduziert werden.

Anleitung

Das Modell ist über ein Google Colab-Notebook zugänglich, das die Konvertierung von HTML in Markdown, die JSON-Extraktion und das Befolgen von Anweisungen demonstriert. Für HTML-zu-Markdown-Aufgaben können Benutzer reines HTML ohne Präfixanweisungen eingeben, während die JSON-Extraktion eine bestimmte Schemaformatierung erfordert. Die Hilfsfunktion create_prompt erleichtert die einfache Erstellung von Eingabeaufforderungen für beide Aufgaben. Obwohl das Modell auf der kostenlosen T4-GPU-Stufe von Colab funktioniert (erfordert vllm und triton), weist es ohne Unterstützung von bfloat16 oder Flash Attention 2 Einschränkungen auf. Für den Produktionseinsatz wird RTX 3090/4090 empfohlen. Das Modell wird auf AWS SageMaker, Azure und dem GCP-Marktplatz verfügbar sein und unter CC BY-NC 4.0 für die nichtkommerzielle Nutzung lizenziert sein.
Blogs, die dieses Modell erwähnen
Mai 25, 2025 • 21 Minuten gelesen
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
Mai 07, 2025 • 9 Minuten gelesen
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
April 08, 2025 • 21 Minuten gelesen
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
Januar 31, 2025 • 14 Minuten gelesen
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
Januar 15, 2025 • 17 Minuten gelesen
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.