I/O 다이어그램 1
I/O 다이어그램 2
I/O 다이어그램 3
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ReaderLM-v2 HTML-to-Markdown · html2mdmain
1262.75
Parameters
1.5B
Rank by score
1 / 3
Pareto front
On it
비교할 모델을 선택하세요
논문 (1)
개요
ReaderLM-v2는 원시 HTML을 마크다운 또는 JSON으로 변환하고 최대 512K 토큰 조합의 입력/출력 길이를 처리하며 29개 언어를 지원하는 1.5B 매개변수 언어 모델입니다. HTML을 마크다운으로 "선택 복사" 작업으로 처리했던 이전 버전과 달리 v2는 이를 번역 프로세스로 처리하여 코드 펜스, 중첩 목록, 테이블 및 LaTeX 방정식과 같은 복잡한 요소를 처리하는 데 탁월합니다. 이 모델은 다양한 컨텍스트 길이에 걸쳐 일관된 성능을 유지하고 사전 정의된 스키마를 사용하여 HTML에서 JSON으로 직접 생성을 도입합니다.
방법
ReaderLM-v2는 Qwen2.5-1.5B-Instruction을 기반으로 구축되었으며, 각 문서에는 평균 56,000개의 토큰이 포함된 1,000만 개의 HTML 문서가 포함된 html-markdown-1m 데이터 세트에서 학습되었습니다. 학습 과정은 다음과 같습니다. 1) Ring-zag Attention과 RoPE를 사용하여 컨텍스트를 32,000개 토큰에서 256,000개 토큰으로 확장하는 장기 컨텍스트 사전 학습. 2) 정제된 데이터 세트를 사용한 감독 미세 조정 3) 출력 정렬을 위한 직접 선호도 최적화 4) 셀프 플레이 강화 조정. 데이터 준비는 Qwen2.5-32B-Instruction에 따라 진행되는 3단계 프로세스(초안-세밀화-검토)를 따릅니다. 여기서는 특정 작업에 맞게 전문화된 모델을 훈련한 다음 선형 매개변수 보간을 통해 병합합니다.
성능
종합 벤치마크에서 ReaderLM-v2는 HTML-to-Markdown 작업에서 Qwen2.5-32B-Instruct 및 Gemini2-flash-expr 같은 더 큰 모델보다 우수한 성능을 보입니다. 주요 콘텐츠 추출에서는 ROUGE-L 0.84, Jaro-Winkler 0.82를 달성했으며, 경쟁 모델 대비 현저히 낮은 Levenshtein 거리(0.22)를 기록했습니다. HTML-to-JSON 작업에서는 F1 점수 0.81, 통과율 98%로 경쟁력 있는 성능을 유지합니다. 이 모델은 T4 GPU에서 입력 67 토큰/초, 출력 36 토큰/초로 처리하며, 대조 손실(contrastive loss) 학습을 통해 퇴화 문제를 크게 줄였습니다.
모범 사례
이 모델은 HTML에서 Markdown으로의 변환, JSON 추출 및 지시 따르기를 보여주는 Google Colab 노트북을 통해 액세스할 수 있습니다. HTML-Markdown 작업의 경우 사용자는 접두사 지시문 없이 원시 HTML을 입력할 수 있지만 JSON 추출에는 특정 스키마 형식이 필요합니다. create_prompt 도우미 함수를 사용하면 두 작업 모두에 대한 프롬프트를 쉽게 생성할 수 있습니다. 모델은 Colab의 무료 T4 GPU 계층(vllm 및 triton 필요)에서 실행될 수 있지만 bfloat16 또는 flash attention 2를 지원하지 않으면 제한이 있습니다. 프로덕션 용도에는 RTX 3090/4090이 권장됩니다. 이 모델은 AWS SageMaker, Azure 및 GCP 마켓플레이스에서 사용할 수 있으며 CC BY-NC 4.0 라이선스에 따라 비상업적 사용이 허가됩니다.
이 모델을 언급하는 블로그









