jina-clip-v2: 텍스트 및 이미지를 위한 다국어 다중 모달 向量模型 (Embeddings)
ReaderLM-V2: HTML에서 Markdown 및 JSON으로의 변환을 위한 小模型 (SLM)
TIPS: 공간 인식을 통한 텍스트-이미지 사전 학습
Cut Cross-Entropy: 큰 어휘에 대한 메모리 효율적인 손실 계산
FlexPrefill: 긴 시퀀스를 위한 컨텍스트 인식 희소 주의
온도 제어를 통한 효과적인 사후 학습 向量模型 (Embeddings) 압축
대규모 언어 모델의 어텐션은 효율적인 제로샷 重排器 (Reranker)를 생성합니다.
직접 선호도 최적화를 위한 쌍별 데이터의 상관 관계 브리징 및 모델링
TAID: 효율적인 지식 전송을 위한 시간 적응 보간 증류 (Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer)
SVD-LLM: 대규모 언어 모델 압축을 위한 절단 인식 특이값 분해 (Truncation-Aware Singular Value Decomposition for Large Language Model Compression)
당신이 들은 것을 보세요: 대규모 멀티모달 모델의 시각적 주의 싱크 (Visual Attention Sink in Large Multimodal Models)
멀티모달 LLM에서 토큰화의 의미론적 등가성 확보
Hymba: 소형 언어 모델을 위한 하이브리드 헤드 아키텍처
이벤트
5월 25, 2025
ICLR2025에서 배운 점
ICLR 2025에서 가장 흥미로운 논문들을 모았습니다. TIPS, FlexPrefill, 제로샷 재정렬기 (Zero-Shot Rerankers), SVD-LLM, Hymba 등이 있습니다.
Jina AI • 21 분 소요
ICLR 2025는 세계에서 가장 크고 영향력 있는 머신러닝 컨퍼런스 중 하나로, NeurIPS 및 ICML과 함께 높은 영향력을 가진 AI 연구를 위한 3대 주요 행사입니다. 올해 ICLR은 아시아에서 처음으로 개최되는 역사적인 이정표를 세웠으며, 4월 24일부터 28일까지 싱가포르 EXPO에서 열렸습니다. 이 시기는 2025년 1월 말 실리콘밸리에 충격을 주고 중국의 빠르게 발전하는 AI 연구를 보여준 "DeepSeek 순간" 이후 몇 달 지나지 않은 완벽한 시점이었습니다. 2024년 2월에 발효된 중국-싱가포르 30일 상호 비자 면제 협정과 함께, 우리는 컨퍼런스에서 중국인 참가자가 전례 없이 급증하는 것을 목격했습니다.
올해 우리 팀은 Sedigheh Eslami, Andreas Koukounas, Wang Feng 및 CEO Han Xiao가 더 나은 검색을 위한 jina-clip-v2 및 ReaderLM-v2에 대한 최신 연구를 보여주는 세 편의 연구 논문을 발표하며 싱가포르 여행을 가게 되어 매우 기뻤습니다. AI 세계의 나머지 부분은 점점 더 커지는 모델을 위한 군비 경쟁에 갇힌 것처럼 보이지만, 우리는 작은 모델이 설계를 올바르게 하면 그 이상의 성능을 발휘할 수 있다는 것을 증명하면서 일반적인 흐름에 역행하기로 결정했습니다.
그러니 커피를 들고 편안하게 앉아 ICLR 연구 중 흥미로운 부분을 살펴보겠습니다. 먼저 작음이 왜 강력할 수 있는지에 대한 우리의 견해부터 시작합니다.
CLIP 모델은 이미지-텍스트 작업에서 뛰어나지만 "모달리티 격차"로 어려움을 겪습니다. 이미지와 텍스트 向量模型 (Embedding)이 별도의 영역에 클러스터링되어 성능이 제한됩니다. Hasso Plattner Institute에서 박사 과정을 밟는 동안 우리 인턴인 Sedigheh Eslami가 주도한 이 연구는 이러한 근본적인 문제를 해결합니다.
우리는 간단한 벡터 변환이 向量模型 (Embedding) 구조를 손상시킨다는 것을 발견했습니다. 대신 AlignCLIP은 의미론적으로 정규화된 분리 목표와 함께 공유 인코더 파라미터를 사용합니다. 이 이중 접근 방식은 제로샷 및 미세 조정 작업에서 성능을 향상시키면서 모달리티 격차를 성공적으로 줄입니다.
주요 내용:
모달리티 격차는 중요한 CLIP 성능 병목 현상입니다.
파라미터 공유 + 의미론적 분리는 모달 차이를 효과적으로 연결합니다.
이 접근 방식은 다운스트림 평가에서 측정 가능한 이점을 제공합니다.
tagjina-clip-v2: 텍스트 및 이미지를 위한 다국어 다중 모달 向量模型 (Embeddings)
이것은 다중 작업, 다단계 대조 학습 접근 방식을 사용하여 텍스트 전용 및 교차 모달 작업을 모두 지원하는 다국어 다중 모달 向量模型 (Embedding) 모델인 jina-clip-v2의 배경이 되는 논문입니다. 이 모델은 텍스트 인코더 (Jina XLM-RoBERTa, 5억 6,100만 개의 파라미터)와 비전 인코더 (EVA02-L14, 3억 400만 개의 파라미터)를 결합하여 총 8억 6,500만 개의 파라미터를 갖습니다. 우리는 29개의 비영어권 언어의 다국어 텍스트와 시각적으로 풍부한 문서에서 훈련하며, 유연한 向量模型 (Embedding) 차원성을 위해 Matryoshka Representation Learning을 사용합니다.
주요 내용:
공유 온도 파라미터를 사용하여 단일 배치에서 이미지-텍스트 및 텍스트-텍스트 데이터를 혼합하면 모달리티 정보 비대칭으로 인해 별도의 훈련보다 성능이 저하됩니다.
교차 모달 정렬을 위한 훈련은 본질적으로 순수한 텍스트 向量模型 (Embedding) 품질을 저하시키며, 근본적인 절충점을 보여줍니다.
向量模型 (Embedding)을 1,024차원에서 256차원으로 줄이면 성능 손실이 1% 미만으로 발생하여 고차원 표현에서 엄청난 비효율성을 드러냅니다.
tagReaderLM-V2: HTML에서 Markdown 및 JSON으로의 변환을 위한 小模型 (SLM)
이것은 효율적인 웹 콘텐츠 추출을 위해 설계된 15억 개의 파라미터를 가진 소형 언어 모델인 ReaderLM-v2의 기반이 되는 논문입니다. 이 모델은 최대 512K 개의 词元 (Tokens)의 문서를 처리하여 지저분한 HTML을 깔끔한 Markdown 또는 JSON 형식으로 변환합니다. 우리의 접근 방식은 지속적인 사전 학습, 지도 학습 미세 조정, 직접 선호도 최적화 및 자체 플레이 반복 튜닝을 결합한 통합 학습 프레임워크를 통해 반복적인 개선을 통해 고품질 학습 데이터를 생성하는 3단계 데이터 합성 파이프라인(DRAFT-REFINE-CRITIQUE)을 결합합니다. ReaderLM-v2는 벤치마크에서 GPT-4o 및 기타 더 큰 모델보다 15-20% 더 나은 성능을 보이며, 특히 100K 词元 (Tokens)을 초과하는 문서에서 뛰어난 성능을 보이는 동시에 훨씬 낮은 계산 요구 사항을 유지합니다.
주요 내용:
1.5B 파라미터 모델은 HTML 추출에서 GPT-4o 및 32B 모델보다 15-20% 더 나은 성능을 보여주며, 작업별 미세 조정이 도메인 전문 지식에 대한 원시 규모보다 중요하다는 것을 입증합니다.
이 모델은 4단계 "자체 플레이"에서 자체 학습 데이터를 생성하여 사람이 큐레이팅한 데이터 세트보다 더 나은 데이터 세트를 만들고 재귀적 피드백을 통해 지속적으로 성능을 향상시킵니다.
이 모델은 학습 중에 치명적인 词元 (Token) 반복으로 어려움을 겪었지만, 차별적 표현을 장려하기 위해 대조 손실을 추가함으로써 이러한 퇴행 문제를 완전히 제거했습니다.
대조 학습으로 학습된 비전-언어 모델은 글로벌 이미지-텍스트 정렬에는 뛰어나지만 밀집된 공간 이해 작업에는 실패합니다. TIPS는 대조 학습과 마스크 이미지 모델링을 결합하고 공간 관계를 인코딩하는 합성적으로 생성된 캡션을 사용하여 작업별 미세 조정 없이도 밀집되고 글로벌한 이해에 적합한 向量模型 (Embeddings)을 생성합니다. 이 접근 방식은 더 나은 문서 이해 및 다중 모드 검색 애플리케이션을 위해 공간 인식을 向量模型 (Embedding)에 통합할 수 있는 방법을 보여줍니다.
주요 내용:
공간 설명이 포함된 합성 캡션은 공간적으로 인식된 표현을 학습하기 위한 시끄러운 웹 캡션보다 더 풍부한 학습 신호를 제공합니다.
대조적인 이미지-텍스트 학습과 자기 지도 목표를 결합하면 글로벌 및 밀집된 이해 사이의 격차가 해소됩니다.
다양한 작업에 대한 즉시 사용 가능한 성능은 다양한 비전 애플리케이션에서 특수화된 미세 조정의 필요성을 없애줍니다.
교차 엔트로피 계산은 큰 어휘 언어 모델에서 메모리 사용량을 지배하며, batch_size × vocabulary_size에 비례하는 로짓 행렬의 구체화를 필요로 합니다. CCE는 사용자 정의 CUDA 커널을 사용하여 즉석에서 필요한 구성 요소만 계산하도록 계산을 재구성하여 메모리 소비를 기가바이트에서 메가바이트로 줄이면서 동일한 학습 역학을 유지합니다. 이를 통해 제한된 하드웨어에서 더 큰 어휘로 向量模型 (Embedding) 및 重排器 (Reranker) 모델을 학습할 수 있으며, 특히 다국어 및 도메인별 애플리케이션에 유용합니다.
주요 내용:
교차 엔트로피 손실 계산은 큰 어휘 모델의 경우 학습 메모리의 90%를 소비할 수 있으며, 주요 병목 현상이 됩니다.
로그 합계 지수 항의 즉석 계산은 수학적 근사 없이 전체 로짓 행렬을 구체화할 필요성을 없애줍니다.
사용자 정의 커널 구현은 정확한 수렴 속성을 유지하면서 극적인 메모리 감소를 가능하게 합니다.
긴 시퀀스 트랜스포머 추론은 이차 어텐션 복잡성으로 인해 어려움을 겪습니다. FlexPrefill은 Jensen-Shannon 발산을 사용하여 헤드별로 희소 어텐션 패턴을 동적으로 결정하고 누적 어텐션 점수를 기반으로 계산 예산을 적응적으로 할당하여 다양한 콘텐츠 유형에서 최소한의 정확도 손실로 상당한 속도 향상을 달성합니다. 이 방법은 검색 시스템을 위한 긴 문서의 효율적인 처리를 가능하게 하며, 더 작은 언어 모델이 더 나은 문서 이해를 위해 확장된 컨텍스트를 처리할 수 있도록 합니다.
주요 내용:
콘텐츠 유형에 적응된 동적 희소 어텐션 패턴이 다양한 입력 특성에서 고정된 희소 전략보다 성능이 뛰어납니다.
어텐션 점수 누적을 기반으로 한 헤드별 적응형 예산 할당은 실시간으로 계산 분산을 최적화합니다.
컨텍스트 인식 희소성은 모델 재학습 없이 0.1% 정확도 손실로 13.7배의 속도 향상을 달성합니다.
대조 학습에서 온도 스케일링은 학습된 向量模型 (Embeddings)의 고유 차원에 상당한 영향을 미치며, 낮은 온도는 더 압축 가능한 표현을 생성합니다. 이 논문은 온도 집계 방법이 검색 성능을 유지하면서 向量模型 (Embeddings) 차원을 10배까지 줄일 수 있음을 보여주며, 클러스터링 효과와 검색 정확도 간의 절충점을 보여줍니다. 이는 메모리 제약 조건이 프로덕션 애플리케이션에 중요한 밀집 검색 시스템의 효율적인 배포를 가능하게 합니다.
주요 내용:
대조 학습에서 낮은 온도 값은 더 효과적으로 압축되는 더 낮은 고유 차원을 가진 向量模型 (Embeddings)을 생성합니다.
온도 집계 기술은 검색 작업 전반에서 품질 저하를 최소화하면서 10배의 압축률을 달성합니다.
학습 중 온도에 대한 체계적인 제어는 압축-성능 절충점을 최적화하기 위한 직접적인 메커니즘을 제공합니다.
tag대규모 언어 모델의 어텐션은 효율적인 제로샷 重排器 (Reranker)를 생성합니다.
컨텍스트 내 重排 (Re-ranking) (ICR)는 LLM에서 어텐션 패턴 변화를 활용하여 텍스트 생성 없이 문서 重排 (Re-ranking)을 수행하여 계산 복잡도를 O(N log N)에서 O(1)로 줄입니다. 이 방법은 레이어와 헤드에 걸쳐 어텐션 가중치를 집계하여 관련성 점수를 계산하고 콘텐츠가 없는 쿼리 보정을 통해 LLM 편향을 완화합니다. 이 접근 방식은 특수 미세 조정 또는 비용이 많이 드는 생성 프로세스 없이 오픈 웨이트 모델을 사용하여 효율적인 重排 (Re-ranking)을 가능하게 합니다.
주요 내용:
LLM의 어텐션 패턴은 텍스트 생성이 필요 없이 효과적인 문서 重排 (Re-ranking)을 위한 충분한 신호를 포함합니다.
콘텐츠가 없는 쿼리 보정은 어텐션 기반 점수 메커니즘의 고유한 편향을 성공적으로 완화합니다.
ICR은 특히 복잡한 다중 홉 검색 작업에서 생성형 방법에 비해 우수한 성능과 효율성을 달성합니다.
기존 DPO는 선호도 쌍에서 선택된 응답과 거부된 응답 간의 상관 관계가 약하여 정렬 효과가 제한됩니다. BMC는 승리 응답과 패배 응답 사이를 보간하는 의사 선호 응답을 합성한 다음 정책 모델 신뢰도를 사용하여 토큰 수준 상관 관계 모델링을 적용합니다. 2단계 접근 방식은 먼저 대상 수정 (targeted modifications)을 통해 선호도 쌍을 연결한 다음 학습 중에 세분화된 상관 관계를 모델링하여 학습 신호 품질을 향상시킵니다.
주요 내용:
선호도 데이터에서 선택된 응답과 거부된 응답 간의 약한 상관 관계는 모델 정렬에 대한 DPO 효과를 크게 제한합니다.
선호도 쌍 간의 보간으로 의사 선호 응답을 합성하면 최적화를 위한 더 풍부한 학습 신호가 제공됩니다.
정책 신뢰도를 사용하는 토큰 수준 상관 관계 모델링은 훈련 신호에 동적으로 가중치를 부여하여 선호도 데이터의 미묘한 변화를 포착합니다.
tagTAID: 효율적인 지식 전송을 위한 시간 적응 보간 증류 (Temporally Adaptive Interpolated Distillation for Efficient Knowledge Transfer)
지식 증류 (Knowledge distillation)는 대형 모델과 소형 모델 간에 지식을 전송할 때 용량 격차, 모드 평균화 및 모드 붕괴로 인한 문제에 직면합니다. TAID는 학생 및 교사 분포 사이를 보간하는 동적 중간 교사를 도입하여 훈련 진행 상황에 따라 대상 분포를 점진적으로 조정합니다. 이 접근 방식은 이론적 보장을 통해 모드 붕괴를 방지하고 다양한 모델 크기에서 우수한 성능을 달성하여 컴팩트하면서도 유능한 언어 모델 개발을 가능하게 합니다.
주요 내용:
훈련 중에 적응하는 동적 중간 교사는 고정된 교사 증류에 비해 더 부드러운 학습 궤적을 제공합니다.
TAID는 적응형 보간을 통해 모드 붕괴를 방지하는 동시에 다양한 용량 격차에서 지식 전송의 균형을 유지합니다.
이 방법을 사용하면 특수 아키텍처나 광범위한 하이퍼파라미터 조정 없이 최첨단 컴팩트 모델을 훈련할 수 있습니다.
tagSVD-LLM: 대규모 언어 모델 압축을 위한 절단 인식 특이값 분해 (Truncation-Aware Singular Value Decomposition for Large Language Model Compression)
기존 SVD 기반 압축 방법은 근사화 중에 입력 활성화를 고려하지 못하고 절단 후 미세 조정이 부족합니다. SVD-LLM은 활성화 분포를 고려하는 절단 인식 데이터 화이트닝을 통합하고 압축 후 LoRA 기반 미세 조정을 적용합니다. 이 방법은 특이값과 압축 손실 간의 이론적 연결을 설정하여 구조화된 가지치기 및 양자화 접근 방식보다 뛰어난 원칙적인 압축 결정을 가능하게 합니다.
주요 내용:
입력 활성화를 고려하는 절단 인식 데이터 화이트닝은 활성화에 구애받지 않는 방법보다 SVD 압축 효과를 크게 향상시킵니다.
압축 후 LoRA 미세 조정은 저랭크 인수 분해의 이점을 유지하면서 정확도 저하를 보상합니다.
특이값을 압축 손실에 연결하는 이론적 분석은 휴리스틱 접근 방식보다 뛰어난 원칙적인 절단 결정을 가능하게 합니다.
tag당신이 들은 것을 보세요: 대규모 멀티모달 모델의 시각적 주의 싱크 (Visual Attention Sink in Large Multimodal Models)
대규모 멀티모달 모델은 해당 텍스트 토큰과 관련이 없는 특정 시각적 토큰에 높은 어텐션 가중치를 일관되게 할당하는 "시각적 어텐션 싱크 (visual attention sink)"라는 현상을 보입니다. 이러한 관련 없는 시각적 토큰은 언어 모델의 어텐션 싱크와 유사하게 특정 숨겨진 상태 차원에서 과도한 활성화로 인해 발생합니다. VAR (Visual Attention Redistribution) 방법은 이미지 중심 어텐션 헤드를 식별하고 싱크 토큰에서 의미 있는 시각적 콘텐츠로 어텐션 예산을 재분배하여 추가 학습 없이 시각-언어 작업 전반에서 성능을 향상시킵니다.
주요 내용:
시각적 싱크 토큰은 기본 언어 모델에서 상속된 고정된 차원에서 극단적인 활성화 크기로 식별할 수 있습니다.
시각적 싱크 토큰을 제거해도 높은 어텐션 가중치를 받음에도 불구하고 모델 성능에 영향을 미치지 않으며 이는 계산 자원 낭비를 의미합니다.
VAR은 싱크 토큰에서 의미 있는 시각적 콘텐츠로 어텐션을 재분배하여 일반적인 시각-언어, 환각 감소 및 시각 중심 작업에서 성능을 향상시킵니다.
멀티모달 LLM의 기존 비전 토큰화 방법은 고정된 패치를 사용하여 시각적 입력을 조각화하여 의미론적 무결성을 손상시키고 시각-언어 정렬 불량을 초래합니다. SeTok (Semantic-Equivalent Vision Tokenizer)은 토큰 수를 이미지 복잡성에 따라 조정하여 시각적 특징을 일관된 의미론적 단위로 그룹화하는 동적 클러스터링을 통해 이를 해결합니다. 이 시스템은 언어와의 의미론적 정렬을 위한 대조 손실과 이미지 재구성을 위한 픽셀 수준의 세부 정보를 보존하기 위한 재구성 손실의 두 가지 학습 목표를 사용합니다.
주요 내용:
고정 패치 토큰화는 임의의 패치 경계를 넘어 객체를 조각화하여 시각적 의미론적 무결성을 파괴합니다.
동적 클러스터링 알고리즘은 고정된 그리드 구조가 아닌 이미지 의미론적 복잡성을 기반으로 최적의 토큰 수를 적응적으로 결정할 수 있습니다.
이중 목표 학습은 언어와의 의미론적 정렬과 재구성 작업을 위한 충분한 시각적 세부 정보 보존 사이의 균형을 맞춥니다.
Hymba는 각 계층 내에서 트랜스포머 어텐션 메커니즘과 SSM (state space models)을 병렬로 결합하여 동시 고해상도 리콜 및 효율적인 컨텍스트 요약을 가능하게 하는 하이브리드 헤드 아키텍처를 도입합니다. 이 아키텍처는 학습 가능한 메타 토큰, 계층 간 키-값 공유 및 부분 슬라이딩 윈도우 어텐션을 통합하여 컴팩트한 캐시 크기를 달성합니다. Hymba-1.5B는 모든 2B 미만 모델을 능가하고 Llama-3.2-3B보다 뛰어난 성능을 보이면서 캐시 감소율 11.67배, 처리량 향상률 3.49배를 달성했습니다.
주요 내용:
병렬 하이브리드 헤드 아키텍처는 상호 보완적인 메커니즘의 동시 처리를 가능하게 함으로써 어텐션 및 SSM 구성 요소의 순차적 스태킹보다 뛰어난 성능을 제공합니다.
학습 가능한 메타 토큰은 압축된 세계 지식 역할을 하며 softmax 어텐션 메커니즘의 "강제 참석" 부담을 완화합니다.
계층 간 키-값 공유 및 슬라이딩 윈도우 어텐션 최적화는 성능 저하 없이 극적인 캐시 크기 감소를 달성합니다.