Überblick
ReaderLM-v2 ist ein 1,54B-Parameter-Kleinsprachmodell, das unordentliches HTML in sauberes Markdown oder JSON mit hoher Genauigkeit umwandelt und Dokumente bis 512K Token verarbeitet. Das ideale Werkzeug für LLM-Grounding: Webinhalte in strukturierte Formate konvertieren. Übertrifft Qwen2.5-32B-Instruct und Gemini2-flash-expr bei HTML-zu-Markdown — bei einem Bruchteil der Kosten.
Methoden
Die Wirksamkeit des Modells beruht auf zwei Schlüsselinnovationen. Erstens erzeugt eine dreistufige Datensynthese-Pipeline qualitativ hochwertige, vielfältige Trainingsdaten, indem sie die Extraktion von Webinhalten iterativ entwirft, verfeinert und kritisch hinterfragt — dieser synthetische Ansatz stellt sicher, dass das Modell eine breite Vielfalt an HTML-Strukturen sieht, ohne manuelle Annotation zu benötigen. Zweitens kombiniert ein einheitlicher Trainingsrahmen kontinuierliches Pretraining mit Multi-Objective-Optimierung, sodass das Modell sowohl HTML-zu-Markdown- als auch HTML-zu-JSON-Konvertierung gleichzeitig lernt. Die 'flach, aber breit' aufgebaute nur-dekodierende Architektur (28 Schichten, 1536 Hidden-Dimensionen, 12 Query-Heads, 2 KV-Heads) ist für selektive Kopiervorgänge optimiert. Der 512K-Token-Kontext wird über zigzag-ring-attention ermöglicht. Training mit kontrastivem Verlust reduziert Degenerationsprobleme erheblich.
Leistung
HTML-zu-Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — übertrifft Qwen2.5-32B-Instruct und Gemini2-flash-expr. HTML-zu-JSON: F1 0,81, 98% Pass-Rate. 67 Token/s Eingabe, 36 Token/s Ausgabe auf T4. Degeneration (Token-Loops) deutlich reduziert. 512K Kontext eliminiert Chunking für die meisten echten Dokumente.
Anleitung
Das Modell ist über ein Google-Colab-Notebook zugänglich, das HTML-zu-Markdown-Konvertierung, JSON-Extraktion und Instruction-Following demonstriert. Für HTML-zu-Markdown-Aufgaben rohes HTML ohne Präfix-Anweisungen eingeben. Für JSON-Extraktion das Zielschema im Prompt angeben. Die create_prompt-Hilfsfunktion erleichtert die Prompt-Erstellung für beide Aufgaben. Das Modell läuft auf der kostenlosen T4-GPU-Ebene von Colab (erfordert vllm und triton), hat aber ohne bfloat16- oder Flash-Attention-2-Unterstützung Einschränkungen; für Produktion wird RTX 3090/4090 empfohlen. Verfügbar im AWS SageMaker, Azure- und GCP-Marktplatz. Lizenziert unter CC BY-NC 4.0 für nicht-kommerzielle Nutzung. Verwenden Sie das Modell als Preprocessing-Schritt in RAG-Pipelines, um Webinhalte vor dem Einbetten mit jina-embeddings-v5-text-small in sauberes Markdown zu konvertieren.









