개요
ReaderLM-v2는 1.54B 매개변수의 소형 언어 모델로, 어지러운 HTML을 높은 정확도로 깔끔한 Markdown 또는 JSON으로 변환하며, 최대 512K 토큰 문서를 처리합니다. LLM grounding에 이상적인 도구: 웹 콘텐츠를 LLM이 효율적으로 소비할 수 있는 구조화된 형식으로 변환. HTML-to-Markdown에서 Qwen2.5-32B-Instruct와 Gemini2-flash-expr를 능가 — 비용은 그 일부에 불과.
방법
이 모델의 효과성은 두 가지 핵심 혁신에서 비롯됩니다. 첫째, 3단계 데이터 합성 파이프라인이 웹 콘텐츠 추출을 반복적으로 작성·정제·비평함으로써 고품질이고 다양한 학습 데이터를 생성합니다 — 이 합성 데이터 방식은 수동 어노테이션 없이도 모델이 다양한 HTML 구조를 접하게 합니다. 둘째, 통합 학습 프레임워크가 지속적 사전학습과 다목적 최적화를 결합하여 HTML-대-Markdown 변환과 HTML-대-JSON 변환을 동시에 학습합니다. 'shallow-but-wide'(얕고 넓은) 디코더 전용 아키텍처(28개 레이어, 1536차원 숨겨진 계층, 12개 쿼리 헤드, 2개 KV 헤드)는 선택적 복사 작업에 최적화되어 있습니다. 512K 토큰 컨텍스트는 zigzag-ring-attention을 통해 구현됩니다. 대비 손실 훈련은 변이(degeneration) 문제를 크게 줄입니다.
성능
HTML-대-Markdown 작업에서 이 모델은 ROUGE-L 0.84, Jaro-Winkler 0.82, Levenshtein 거리 0.22를 달성하며 Qwen2.5-32B-Instruct와 Gemini2-flash-expr를 능가합니다. HTML-대-JSON 작업에서는 F1 점수 0.81과 98% 통과율로 경쟁적인 성능을 유지합니다. T4 GPU에서 입력 67 tokens/s, 출력 36 tokens/s로 처리합니다. 변이 문제(토큰 루프, 반복 출력)는 대비 손실 훈련으로 크게 줄었습니다. 512K 토큰 컨텍스트 윈도우는 대부분의 실제 문서에서 청킹(chunking)을 불필요하게 만듭니다.
모범 사례
이 모델은 HTML-대-Markdown 변환, JSON 추출, 지시 추적을 데모하는 Google Colab 노트북을 통해 사용할 수 있습니다. HTML-대-Markdown 작업에는 접두어 지시 없이 원시 HTML을 입력하세요. JSON 추출에는 프롬프트에서 대상 스키마를 지정하세요. create_prompt 헬퍼 함수가 두 작업의 프롬프트 작성을 쉽게 해줍니다. 이 모델은 Colab의 무료 T4 GPU 티어에서 동작합니다(vllm와 triton 필요)가, bfloat16 또는 Flash Attention 2 지원이 없으면 제한이 있습니다. 프로덕션에는 RTX 3090/4090을 권장합니다. AWS SageMaker, Azure, GCP 마켓플레이스에서 사용 가능합니다. 비상업적 사용용으로 CC BY-NC 4.0 라이선스가 적용됩니다. 이 모델을 RAG 파이프라인의 전처리 단계로 사용해 jina-embeddings-v5-text-small 임베딩 전에 웹 콘텐츠를 깨끗한 Markdown으로 변환하세요.









