개요
jina-vlm는 2.4B 파라미터의 다국어 비전-언어 모델로, 오픈 2B 스케일 VLM 중 SOTA VQA 성능을 달성합니다. SigLIP2 비전 인코더를 Qwen3 언어 디코더와 어텐션 풀링 커넥터를 통해 결합하여, 임의 해상도 이미지의 토큰 효율적 처리를 가능하게 합니다. 모델은 29개 언어와 32K 토큰 컨텍스트를 지원하여, 문서 이해, 차트 분석, OCR, 다국어 시각 질의응답에 적합합니다.
방법
아키텍처는 SigLIP2 비전 인코더와 Qwen3 언어 디코더를 결합하며, 임의 해상도 이미지의 토큰 효율적 처리를 가능하게 하는 어텐션 풀링 메커니즘으로 연결되어 있습니다. 핵심 혁신은 어텐션 풀링 커넥터로, 2×2 풀링을 적용하여 타일당 729개의 비주얼 토큰을 182로 줄입니다(4× 토큰 감소). LLM 프리필 FLOPs를 3.9× 감소시키고, 벤치마크 점수에 최소 영향으로 KV 캐시 메모리를 4× 감소시킵니다. 이미지는 타일링으로 처리됩니다: 임의 해상도 이미지는 최대 12개 타일과 썸네일로 나뉘며, 각각 독립적으로 처리된 후 결합됩니다. 모델은 아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어 등 29개 언어를 커버하는 다양한 다국어 VQA 데이터셋으로 훈련되었습니다. leave-one-out 데이터 믹스 애블레이션 연구는 어떤 데이터 카테고리(작업, 도메인, 모달리티, 언어)가 필요한지 중복인지 진단하여, 효율적 데이터 배분을 이끌었습니다.
성능
모델은 2B 스케일 VLM 중 8개 VQA 벤치마크 전체에서 가장 높은 평균 점수(72.3)를 달성합니다: MathVista(59.4), AI2D(80.8), ChartQA(79.5), DocVQA(90.6), InfoVQA(65.9), RealWorldQA(64.9), OCRBench(778/1000), MME(1582). 다국어 멀티모달 이해에서 선두입니다: MMMB(78.8)와 Multilingual MMBench(74.3), 아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어를 커버. OCR 성능은 OCRBench에서 778(0–1000 스케일)로 강합니다. 텍스트만 성능은 경쟁적입니다: MMLU(54.7), HellaSwag(75.6), 비전-언어 통합으로 MMLU-Pro에서는 저하(30.3 대 기본 46.4). 어텐션 풀링의 4× 토큰 감소는 LLM 프리필 FLOPs 3.9× 감소와 KV 캐시 메모리 4× 감소로 이어지며, 벤치마크 영향은 최소입니다.
모범 사례
모델은 Hugging Face에서 CC-BY-NC-4.0 아래 가중치와 추론 코드와 함께 사용할 수 있습니다. 자동 타일링(최대 12개 타일과 썸네일)을 통해 임의 해상도 이미지를 지원합니다. 복잡한 추론 작업에는 do_sample=True와 temperature > 0를 활성화해 싱킹 모드를 사용하세요. 모델은 확장된 대화를 위해 32K 컨텍스트 길이를 처리합니다. 다국어 VQA에서 영어, 중국어, 아랍어, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 터키어, 베트남어, 태국어, 인도네시아어, 힌디어, 벵골어를 포함해 29개 언어를 지원합니다. 문서 이해, 차트/다이어그램 분석, OCR 작업, 다국어 시각 질의응답에 최적입니다. 한계: 카운팅 작업과 세밀한 공간 추론은 타일링 접근에 의해 영향을 받을 수 있습니다. 최적의 추론을 위해 CUDA 지원 GPU에서 bfloat16 정밀도를 사용하세요. Apple Silicon에는 MLX 추론이 지원됩니다. 시각 문서에 대한 임베딩 기반 검색에는 jina-embeddings-v4 또는 jina-reranker-m0와 짝지어 사용하세요.




