Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
warning
Dieses Modell wird durch neuere Modelle ersetzt.
Reader
copyright CC BY-NC 4.0
open_in_new Beitrag veröffentlichen

reader-lm-0.5b

Ein kleines Sprachmodell zur Konvertierung von reinem HTML in Markdown
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2024-08-11
Eingang
abc
Text (HTML)
arrow_forward
Ausgabe
abc
Text (Markdown)
Modelldetails
Parameter: 494M
Länge des Eingabetokens: 256K
Basismodell help_outline
open_in_new
Qwen2-0.5B-Instruct
Ausgebildete Sprachen help_outline
2 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Ähnliche Modelle
link
reader-lm-1.5b
Erhältlich über
AWS SageMaker
Microsoft Azure
Hugging Face
Air-Gapped
E/A-Diagramm

HTML

reader-lm

Preisnachlass

Pareto-Fronthelp_outline
Reader-LM v1 HTML-to-Markdown
Reader-LM v1 HTML-to-Markdown · TER
chevron_leftchevron_right
1B3.0B10B30B100B0.20.30.40.50.60.7llama-3.1-70bQwen2-7B-Instructreader-lm-1.5breader-lm-0.5bParameter (log)ROUGE-L
Dieses Modell
Auf der Front
Jina AI
Andere
Reader-LM v1 HTML-to-Markdown
0.560
Parameter
494M
Rang nach Score
2 / 4
Pareto-Front
Darauf
Wählen Sie Modelle zum Vergleichen aus

Überblick

Reader LM 0.5B ist ein spezialisiertes Sprachmodell, das die komplexe Herausforderung der Konvertierung von HTML-Dokumenten in sauberen, strukturierten Markdown-Text löst. Dieses Modell erfüllt ein wichtiges Bedürfnis moderner Datenverarbeitungs-Pipelines: die effiziente Umwandlung unübersichtlicher Webinhalte in ein Format, das sich ideal für LLMs und Dokumentationssysteme eignet. Im Gegensatz zu allgemeinen Sprachmodellen, die enorme Rechenressourcen erfordern, erreicht Reader LM 0.5B eine professionelle HTML-Verarbeitung mit nur 494 Millionen Parametern und ist damit für Teams mit begrenzten Rechenressourcen zugänglich. Organisationen, die sich mit der Verarbeitung von Webinhalten, der Automatisierung von Dokumentationen oder der Entwicklung von LLM-basierten Anwendungen befassen, werden dieses Modell besonders wertvoll finden, um ihre Workflows zur Inhaltsvorbereitung zu optimieren.

Methoden

Das Modell verwendet eine innovative „flache, aber breite“ Architektur, die speziell für selektive Kopiervorgänge und nicht für die kreative Textgenerierung optimiert ist. Das Modell basiert auf einer reinen Decoder-Grundlage mit 24 Schichten und 896 verborgenen Dimensionen und verwendet spezialisierte Aufmerksamkeitsmechanismen mit 14 Abfrageköpfen und 2 Schlüssel-Wert-Köpfen, um Eingabesequenzen effizient zu verarbeiten. Der Trainingsprozess umfasste zwei unterschiedliche Phasen: zuerst mit kürzerem, einfacherem HTML (32.000 Token), um grundlegende Konvertierungsmuster zu erlernen, dann mit komplexem, realitätsnahem HTML (128.000 Token), um anspruchsvolle Fälle zu bewältigen. Das Modell integriert während des Trainings eine kontrastive Suche und implementiert einen Wiederholungserkennungsmechanismus, um Degenerationsprobleme wie Token-Schleifen zu verhindern. Ein einzigartiger Aspekt seiner Architektur ist der Zickzack-Ring-Aufmerksamkeitsmechanismus, der es dem Modell ermöglicht, extrem lange Sequenzen mit bis zu 256.000 Token zu verarbeiten und dabei eine stabile Leistung aufrechtzuerhalten.

Leistung

In Tests unter realen Bedingungen zeigt Reader LM 0.5B beeindruckende Effizienz-Leistungs-Verhältnisse in mehreren Metriken. Das Modell erreicht einen ROUGE-L-Score von 0,56, was auf eine starke Inhaltserhaltung hinweist, und behält eine niedrige Token-Fehlerrate von 0,34 bei, was auf minimale Halluzinationen hinweist. In qualitativen Bewertungen von 22 verschiedenen HTML-Quellen, darunter Nachrichtenartikel, Blogbeiträge und E-Commerce-Seiten in mehreren Sprachen, zeigt es besondere Stärken in Bezug auf Strukturerhaltung und Verwendung der Markdown-Syntax. Das Modell eignet sich hervorragend für die Verarbeitung komplexer moderner Webseiten, bei denen Inline-CSS und Skripte auf Hunderttausende von Token erweitert werden können – ein Szenario, in dem herkömmliche regelbasierte Ansätze oft versagen. Es ist jedoch wichtig zu beachten, dass das Modell zwar bei einfachen HTML-zu-Markdown-Konvertierungsaufgaben außergewöhnlich gut abschneidet, für hochdynamische oder JavaScript-lastige Seiten jedoch möglicherweise zusätzliche Verarbeitung erfordert.

Anleitung

Um Reader LM 0.5B effektiv einzusetzen, sollten Organisationen sicherstellen, dass ihre Infrastruktur die CUDA-Anforderungen des Modells erfüllen kann, obwohl seine effiziente Architektur es auf GPUs für Verbraucher laufen lässt. Das Modell funktioniert am besten mit rohem HTML-Input und erfordert keine speziellen Präfixe oder Anweisungen. Für optimale Leistung implementieren Sie den bereitgestellten Wiederholungserkennungsmechanismus, um potenzielle Token-Schleifen bei der Ausgabegenerierung zu verhindern. Obwohl das Modell mehrere Sprachen und verschiedene HTML-Strukturen unterstützt, ist es speziell für die Inhaltsextraktion und Markdown-Konvertierung konzipiert – es sollte nicht für Aufgaben wie Textgenerierung, Zusammenfassung oder direkte Beantwortung von Fragen verwendet werden. Das Modell ist über AWS SageMaker für die Produktionsbereitstellung verfügbar, und zum Testen und Experimentieren steht ein Google Colab-Notebook zur Verfügung. Teams sollten sich bewusst sein, dass das Modell zwar extrem lange Dokumente mit bis zu 256.000 Token verarbeiten kann, die Verarbeitung derart großer Eingaben jedoch möglicherweise zusätzliche Speicherverwaltungsstrategien erfordert.
Blogs, die dieses Modell erwähnen
Januar 15, 2025 • 17 Minuten gelesen
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
September 11, 2024 • 13 Minuten gelesen
Reader-LM: Small Language Models for Cleaning and Converting HTML to Markdown
Reader-LM-0.5B and Reader-LM-1.5B are two novel small language models inspired by Jina Reader, designed to convert raw, noisy HTML from the open web into clean markdown.
Jina AI
Technical screenshot displaying "REAPER-LM-0.5B/1.5B" with HTML source code for Jina's search grounding feature.
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.