Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Reader
copyright CC BY-NC 4.0
open_in_new Release-Post

ReaderLM-v2

Ein kleines Sprachmodell zur Konvertierung von reinem HTML in Markdown oder JSON
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2025-01-16
Eingabe
abc
Text (HTML)
arrow_forward
Ausgabe
abc
Text (Markdown)
abc
Text (JSON)
Modelldetails
Parameter: 1.54B
Länge des Eingabetokens: 512K
Basismodell help_outline
open_in_new
Qwen2.5-1.5B-Instruct
Ausgebildete Sprachen help_outline
14 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Ähnliche Modelle
link
reader-lm-1.5b
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-Gapped
E/A-Diagramm 1

HTML

ReaderLM-v2

Markdown

E/A-Diagramm 2

HTML

ReaderLM-v2

Anweisung

JSON

E/A-Diagramm 3

HTML

ReaderLM-v2

Anweisung

Markdown

Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
ICLR 2025
März 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON

Überblick

ReaderLM-v2 ist ein 1,54B-Parameter-Kleinsprachmodell, das unordentliches HTML in sauberes Markdown oder JSON mit hoher Genauigkeit umwandelt und Dokumente bis 512K Token verarbeitet. Das ideale Werkzeug für LLM-Grounding: Webinhalte in strukturierte Formate konvertieren. Übertrifft Qwen2.5-32B-Instruct und Gemini2-flash-expr bei HTML-zu-Markdown — bei einem Bruchteil der Kosten.

Methoden

Die Wirksamkeit des Modells beruht auf zwei Schlüsselinnovationen. Erstens erzeugt eine dreistufige Datensynthese-Pipeline qualitativ hochwertige, vielfältige Trainingsdaten, indem sie die Extraktion von Webinhalten iterativ entwirft, verfeinert und kritisch hinterfragt — dieser synthetische Ansatz stellt sicher, dass das Modell eine breite Vielfalt an HTML-Strukturen sieht, ohne manuelle Annotation zu benötigen. Zweitens kombiniert ein einheitlicher Trainingsrahmen kontinuierliches Pretraining mit Multi-Objective-Optimierung, sodass das Modell sowohl HTML-zu-Markdown- als auch HTML-zu-JSON-Konvertierung gleichzeitig lernt. Die 'flach, aber breit' aufgebaute nur-dekodierende Architektur (28 Schichten, 1536 Hidden-Dimensionen, 12 Query-Heads, 2 KV-Heads) ist für selektive Kopiervorgänge optimiert. Der 512K-Token-Kontext wird über zigzag-ring-attention ermöglicht. Training mit kontrastivem Verlust reduziert Degenerationsprobleme erheblich.

Leistung

HTML-zu-Markdown: ROUGE-L 0,84, Jaro-Winkler 0,82, Levenshtein 0,22 — übertrifft Qwen2.5-32B-Instruct und Gemini2-flash-expr. HTML-zu-JSON: F1 0,81, 98% Pass-Rate. 67 Token/s Eingabe, 36 Token/s Ausgabe auf T4. Degeneration (Token-Loops) deutlich reduziert. 512K Kontext eliminiert Chunking für die meisten echten Dokumente.

Anleitung

Das Modell ist über ein Google-Colab-Notebook zugänglich, das HTML-zu-Markdown-Konvertierung, JSON-Extraktion und Instruction-Following demonstriert. Für HTML-zu-Markdown-Aufgaben rohes HTML ohne Präfix-Anweisungen eingeben. Für JSON-Extraktion das Zielschema im Prompt angeben. Die create_prompt-Hilfsfunktion erleichtert die Prompt-Erstellung für beide Aufgaben. Das Modell läuft auf der kostenlosen T4-GPU-Ebene von Colab (erfordert vllm und triton), hat aber ohne bfloat16- oder Flash-Attention-2-Unterstützung Einschränkungen; für Produktion wird RTX 3090/4090 empfohlen. Verfügbar im AWS SageMaker, Azure- und GCP-Marktplatz. Lizenziert unter CC BY-NC 4.0 für nicht-kommerzielle Nutzung. Verwenden Sie das Modell als Preprocessing-Schritt in RAG-Pipelines, um Webinhalte vor dem Einbetten mit jina-embeddings-v5-text-small in sauberes Markdown zu konvertieren.

Blogs, die dieses Modell erwähnen
Mai 25, 2025 • 21 Minuten gelesen
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
Mai 07, 2025 • 9 Minuten gelesen
Model Soup’s Recipe for Embeddings
Boost robustness and performance with model soups: averaging weights. No extra cost, better results.
Bo Wang
Scott Martens
Still life drawing of a purple bowl filled with apples and oranges on a white table. The scene features rich colors against a
April 08, 2025 • 21 Minuten gelesen
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
Januar 31, 2025 • 14 Minuten gelesen
A Practical Guide to Deploying Search Foundation Models in Production
We offer detailed cost and performance breakdowns for three deployment strategies: Jina API, self-hosted K8s, and AWS SageMaker, to help you make the right decision.
Saahil Ognawala
Scott Martens
Abstract cityscape illustration with orange, grey and white buildings, featuring visible balconies with a potted plant.
Januar 15, 2025 • 17 Minuten gelesen
ReaderLM v2: Frontier Small Language Model for HTML to Markdown and JSON
ReaderLM-v2 is a 1.5B small language model for HTML-to-Markdown conversion and HTML-to-JSON extraction with exceptional quality.
Jina AI
Orange text "ReaderLM-u2" on a vibrant dark red digital screen.
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.