I/O 다이어그램 1
I/O 다이어그램 2
비교할 모델을 선택하세요
논문 (2)
개요
jina-vlm은 24억 파라미터 비전-언어 모델로, 공개된 2B급 VLM 중 다국어 시각 질의응답에서 최첨단 성능을 달성합니다. 이 모델은 SigLIP2-So400M 비전 인코더(4억 4,900만 파라미터)와 Qwen3-1.7B 언어 백본을, 공간 정보를 보존하면서 시각 토큰을 4배 줄이는 어텐션 풀링 커넥터로 연결합니다. 12개의 타일과 전역 썸네일을 사용하는 중첩 이미지 타일링 방식을 채택하여 최대 4K에 이르는 임의 해상도의 이미지를 처리할 수 있습니다. 학습 데이터는 29개 언어에 걸쳐 약 500만 개의 멀티모달 샘플과 120억 개의 텍스트 토큰으로 구성되며, 그중 약 절반은 영어이고 나머지는 중국어, 아랍어, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어 등 고자원 및 중간 자원 언어를 포함합니다.
방법
학습은 두 단계로 진행되며, 모든 모델 구성 요소(인코더, 커넥터, 디코더)는 고정 없이 업데이트됩니다. 1단계(정렬 학습)에서는 자연 장면, 문서, 인포그래픽, 다이어그램을 아우르는 캡션 데이터셋(PixmoCap, PangeaIns)을 사용하여 언어 간 의미 그라운딩에 집중하며, 텍스트 전용 작업에서의 성능 저하를 완화하기 위해 15%의 텍스트 전용 데이터를 포함합니다. 커넥터는 인코더 및 디코더보다 높은 학습률과 짧은 워밍업을 사용합니다. 2단계(인스트럭션 튜닝)에서는 다국어 명령-응답 데이터셋(Aya, ShareGPT4V, LLaVA)을 사용하여 대화형 VQA에 맞게 모델을 조정합니다. 어텐션 풀링 커넥터는 2×2 풀링을 적용하여 타일당 729개의 시각 토큰을 182개로 줄여, 성능 손실을 최소화하면서 토큰 수를 4배 감소시킵니다. 약 30% 중첩(112픽셀, 스트라이드 266)의 378×378 타일 방식은 가장자리 정보를 보존합니다.
성능
2B급 VLM(비전-언어 모델) 중 8개 VQA 벤치마크에서 최고 평균 점수(72.3)를 달성했습니다. MathVista(59.4), AI2D(80.8), ChartQA(79.5), DocVQA(90.6), InfoVQA(65.9), RealWorldQA(64.9), OCRBench(778), MME(1582)가 포함됩니다. 다국어 멀티모달 이해에서는 아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어를 포괄하는 MMMB(78.8)와 Multilingual MMBench(74.3)에서 선두를 차지했습니다. OCRBench(0-1000점 척도)에서 778점으로 강력한 OCR 성능을 보였습니다. MMLU(54.7)와 HellaSwag(75.6)에서 경쟁력 있는 텍스트 전용 성능을 보였으나, 비전-언어 통합으로 인해 MMLU-Pro에서는 예상대로 성능 저하(기준 46.4 대비 30.3)가 나타났습니다. 어텐션 풀링에 의한 4배 토큰 감소는 LLM 프리필 FLOPs를 3.9배, KV 캐시 메모리를 4배 줄이면서도 벤치마크 점수에는 최소한의 영향만 미쳤습니다.
모범 사례
이 모델은 Hugging Face에서 CC-BY-NC-4.0 라이선스로 가중치 및 추론 코드와 함께 제공됩니다. 자동 타일 분할(최대 12개 타일과 썸네일)을 통해 임의 해상도의 이미지 처리를 지원합니다. 복잡한 추론 작업의 경우 do_sample=True를 활성화하고 temperature > 0으로 설정하여 사고 모드를 사용하십시오. 이 모델은 32K의 컨텍스트 길이를 처리하여 긴 대화를 지원할 수 있습니다. 다국어 시각적 질의응답을 위해 이 모델은 영어, 중국어, 아랍어, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 터키어, 베트남어, 태국어, 인도네시아어, 힌디어, 벵골어를 포함한 29개 언어를 지원합니다. 문서 이해, 차트/다이어그램 분석, OCR 작업 및 다국어 시각적 질의응답에 가장 적합합니다. 타일 기반 처리 방식으로 인해 개수 세기 작업과 세밀한 공간 추론에는 한계가 있습니다. 최적의 추론 성능을 위해서는 CUDA 지원 GPU에서 bfloat16 정밀도를 사용하십시오.
이 모델을 언급하는 블로그




