Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP terminalCLIarticlellms.txtsmart_toy에이전트data_object스키마menu_book문서



로그인
login
Reader
copyright CC BY-NC 4.0
open_in_new 릴리스 노트

jina-vlm

시각적 질문 답변을 위한 다국어 시각 언어 모델
라이선스
copyright CC-BY-NC-4.0
출시일
calendar_month
2025-12-04
입력
image
이미지
abc
텍스트
arrow_forward
출력
abc
텍스트
모델 세부정보
매개변수: 2.4B
입력 토큰 길이: 32K
입력 이미지 크기: 4096×4096
기본 모델 help_outline
open_in_new
Qwen3-1.7B-Base
훈련된 언어 help_outline
39 언어
지원되는 언어 help_outline
93 언어
Apple Silicon 지원 help_outline
MLX
관련 모델
link
jina-embeddings-v4
link
jina-reranker-m0
다음을 통해 이용 가능
Jina API
Hugging Face
망분리
I/O 다이어그램 1

이미지

jina-vlm

텍스트

텍스트

I/O 다이어그램 2

텍스트

jina-vlm

텍스트

비교할 모델을 선택하세요
논문 (2)
arXiv
12월 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
12월 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

개요

jina-vlm은 24억 파라미터 비전-언어 모델로, 공개된 2B급 VLM 중 다국어 시각 질의응답에서 최첨단 성능을 달성합니다. 이 모델은 SigLIP2-So400M 비전 인코더(4억 4,900만 파라미터)와 Qwen3-1.7B 언어 백본을, 공간 정보를 보존하면서 시각 토큰을 4배 줄이는 어텐션 풀링 커넥터로 연결합니다. 12개의 타일과 전역 썸네일을 사용하는 중첩 이미지 타일링 방식을 채택하여 최대 4K에 이르는 임의 해상도의 이미지를 처리할 수 있습니다. 학습 데이터는 29개 언어에 걸쳐 약 500만 개의 멀티모달 샘플과 120억 개의 텍스트 토큰으로 구성되며, 그중 약 절반은 영어이고 나머지는 중국어, 아랍어, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어 등 고자원 및 중간 자원 언어를 포함합니다.

방법

학습은 두 단계로 진행되며, 모든 모델 구성 요소(인코더, 커넥터, 디코더)는 고정 없이 업데이트됩니다. 1단계(정렬 학습)에서는 자연 장면, 문서, 인포그래픽, 다이어그램을 아우르는 캡션 데이터셋(PixmoCap, PangeaIns)을 사용하여 언어 간 의미 그라운딩에 집중하며, 텍스트 전용 작업에서의 성능 저하를 완화하기 위해 15%의 텍스트 전용 데이터를 포함합니다. 커넥터는 인코더 및 디코더보다 높은 학습률과 짧은 워밍업을 사용합니다. 2단계(인스트럭션 튜닝)에서는 다국어 명령-응답 데이터셋(Aya, ShareGPT4V, LLaVA)을 사용하여 대화형 VQA에 맞게 모델을 조정합니다. 어텐션 풀링 커넥터는 2×2 풀링을 적용하여 타일당 729개의 시각 토큰을 182개로 줄여, 성능 손실을 최소화하면서 토큰 수를 4배 감소시킵니다. 약 30% 중첩(112픽셀, 스트라이드 266)의 378×378 타일 방식은 가장자리 정보를 보존합니다.

성능

2B급 VLM(비전-언어 모델) 중 8개 VQA 벤치마크에서 최고 평균 점수(72.3)를 달성했습니다. MathVista(59.4), AI2D(80.8), ChartQA(79.5), DocVQA(90.6), InfoVQA(65.9), RealWorldQA(64.9), OCRBench(778), MME(1582)가 포함됩니다. 다국어 멀티모달 이해에서는 아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어를 포괄하는 MMMB(78.8)와 Multilingual MMBench(74.3)에서 선두를 차지했습니다. OCRBench(0-1000점 척도)에서 778점으로 강력한 OCR 성능을 보였습니다. MMLU(54.7)와 HellaSwag(75.6)에서 경쟁력 있는 텍스트 전용 성능을 보였으나, 비전-언어 통합으로 인해 MMLU-Pro에서는 예상대로 성능 저하(기준 46.4 대비 30.3)가 나타났습니다. 어텐션 풀링에 의한 4배 토큰 감소는 LLM 프리필 FLOPs를 3.9배, KV 캐시 메모리를 4배 줄이면서도 벤치마크 점수에는 최소한의 영향만 미쳤습니다.

모범 사례

이 모델은 Hugging Face에서 CC-BY-NC-4.0 라이선스로 가중치 및 추론 코드와 함께 제공됩니다. 자동 타일 분할(최대 12개 타일과 썸네일)을 통해 임의 해상도의 이미지 처리를 지원합니다. 복잡한 추론 작업의 경우 do_sample=True를 활성화하고 temperature > 0으로 설정하여 사고 모드를 사용하십시오. 이 모델은 32K의 컨텍스트 길이를 처리하여 긴 대화를 지원할 수 있습니다. 다국어 시각적 질의응답을 위해 이 모델은 영어, 중국어, 아랍어, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 터키어, 베트남어, 태국어, 인도네시아어, 힌디어, 벵골어를 포함한 29개 언어를 지원합니다. 문서 이해, 차트/다이어그램 분석, OCR 작업 및 다국어 시각적 질의응답에 가장 적합합니다. 타일 기반 처리 방식으로 인해 개수 세기 작업과 세밀한 공간 추론에는 한계가 있습니다. 최적의 추론 성능을 위해서는 CUDA 지원 GPU에서 bfloat16 정밀도를 사용하십시오.
이 모델을 언급하는 블로그
12월 04, 2025 • 7 분 소요
Jina-VLM: 작은 다국어 비전 언어 모델
새로운 20억 규모의 비전 언어 모델이 다국어 VQA에서 SOTA를 달성하고, 텍스트 전용 작업에서 치명적인 망각을 겪지 않습니다.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.