Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
데이터 수집
copyright CC BY-NC 4.0
open_in_new 릴리스 포스트

jina-vlm

시각적 질문 답변을 위한 다국어 시각 언어 모델
라이선스
copyright CC-BY-NC-4.0
출시일
calendar_month
2025-12-04
입력
image
이미지
abc
텍스트
arrow_forward
출력
abc
텍스트
모델 세부정보
매개변수: 2.4B
입력 토큰 길이: 32K
입력 이미지 크기: 4096×4096
기본 모델 help_outline
open_in_new
Qwen3-1.7B-Base
open_in_new
SigLIP2 So400m
훈련된 언어 help_outline
39 언어
지원되는 언어 help_outline
93 언어
Apple Silicon 지원 help_outline
MLX
관련 모델
link
jina-embeddings-v4
link
jina-reranker-m0
다음을 통해 이용 가능
Jina API
Hugging Face
망분리
I/O 다이어그램 1

이미지

jina-vlm

텍스트

텍스트

I/O 다이어그램 2

텍스트

jina-vlm

텍스트

파레토 프론트 help_outline
workspace_premium
DocVQA
AI2D
MMBench v1.1
MMMU
OCRBench
chevron_leftchevron_right
300M1B3.0B10B30B100B5060708090Aquila-VL-2BCambrian-1-34BCambrian-1-8BDeepSeek-VL2gemma-3-12b-itgemma-3-4b-itIdefics2-8BInternVL3-2BInternVL3-8BLLaVA-1.5-13BLLaVA-1.5-7BLLaVA-OneVision-0.5BLLaVA-OneVision-72BMiniCPM-V-2Molmo-72BMolmo-7B-DMolmoE-1Bmoondream2Ovis2-2BOvis2-8BPaliGemma-3B-mix-448Pixtral-12BQwen-VL-ChatQwen2.5-VL-72BQwen3-VL-2BSmolVLM-256MSmolVLM-500MSmolVLM-InstructSmolVLM2-2.2Bjina-vlm파라미터 수(로그)accuracy
이 모델
프론트에 있음
Jina AI
기타
AI2D
82.00
매개변수
2.5B
점수 순위
13 / 47
파레토 프론트
프론트 아래
비교할 모델을 선택하세요
논문 (2)
arXiv
12월 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
12월 04, 2025
Jina-VLM: Small Multilingual Vision Language Model

개요

jina-vlm는 2.4B 파라미터의 다국어 비전-언어 모델로, 오픈 2B 스케일 VLM 중 SOTA VQA 성능을 달성합니다. SigLIP2 비전 인코더를 Qwen3 언어 디코더와 어텐션 풀링 커넥터를 통해 결합하여, 임의 해상도 이미지의 토큰 효율적 처리를 가능하게 합니다. 모델은 29개 언어와 32K 토큰 컨텍스트를 지원하여, 문서 이해, 차트 분석, OCR, 다국어 시각 질의응답에 적합합니다.

방법

아키텍처는 SigLIP2 비전 인코더와 Qwen3 언어 디코더를 결합하며, 임의 해상도 이미지의 토큰 효율적 처리를 가능하게 하는 어텐션 풀링 메커니즘으로 연결되어 있습니다. 핵심 혁신은 어텐션 풀링 커넥터로, 2×2 풀링을 적용하여 타일당 729개의 비주얼 토큰을 182로 줄입니다(4× 토큰 감소). LLM 프리필 FLOPs를 3.9× 감소시키고, 벤치마크 점수에 최소 영향으로 KV 캐시 메모리를 4× 감소시킵니다. 이미지는 타일링으로 처리됩니다: 임의 해상도 이미지는 최대 12개 타일과 썸네일로 나뉘며, 각각 독립적으로 처리된 후 결합됩니다. 모델은 아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어 등 29개 언어를 커버하는 다양한 다국어 VQA 데이터셋으로 훈련되었습니다. leave-one-out 데이터 믹스 애블레이션 연구는 어떤 데이터 카테고리(작업, 도메인, 모달리티, 언어)가 필요한지 중복인지 진단하여, 효율적 데이터 배분을 이끌었습니다.

성능

모델은 2B 스케일 VLM 중 8개 VQA 벤치마크 전체에서 가장 높은 평균 점수(72.3)를 달성합니다: MathVista(59.4), AI2D(80.8), ChartQA(79.5), DocVQA(90.6), InfoVQA(65.9), RealWorldQA(64.9), OCRBench(778/1000), MME(1582). 다국어 멀티모달 이해에서 선두입니다: MMMB(78.8)와 Multilingual MMBench(74.3), 아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어를 커버. OCR 성능은 OCRBench에서 778(0–1000 스케일)로 강합니다. 텍스트만 성능은 경쟁적입니다: MMLU(54.7), HellaSwag(75.6), 비전-언어 통합으로 MMLU-Pro에서는 저하(30.3 대 기본 46.4). 어텐션 풀링의 4× 토큰 감소는 LLM 프리필 FLOPs 3.9× 감소와 KV 캐시 메모리 4× 감소로 이어지며, 벤치마크 영향은 최소입니다.

모범 사례

모델은 Hugging Face에서 CC-BY-NC-4.0 아래 가중치와 추론 코드와 함께 사용할 수 있습니다. 자동 타일링(최대 12개 타일과 썸네일)을 통해 임의 해상도 이미지를 지원합니다. 복잡한 추론 작업에는 do_sample=True와 temperature > 0를 활성화해 싱킹 모드를 사용하세요. 모델은 확장된 대화를 위해 32K 컨텍스트 길이를 처리합니다. 다국어 VQA에서 영어, 중국어, 아랍어, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 터키어, 베트남어, 태국어, 인도네시아어, 힌디어, 벵골어를 포함해 29개 언어를 지원합니다. 문서 이해, 차트/다이어그램 분석, OCR 작업, 다국어 시각 질의응답에 최적입니다. 한계: 카운팅 작업과 세밀한 공간 추론은 타일링 접근에 의해 영향을 받을 수 있습니다. 최적의 추론을 위해 CUDA 지원 GPU에서 bfloat16 정밀도를 사용하세요. Apple Silicon에는 MLX 추론이 지원됩니다. 시각 문서에 대한 임베딩 기반 검색에는 jina-embeddings-v4 또는 jina-reranker-m0와 짝지어 사용하세요.

이 모델을 언급하는 블로그
12월 04, 2025 • 7 분 소요
Jina-VLM: 작은 다국어 비전 언어 모델
새로운 20억 규모의 비전 언어 모델이 다국어 VQA에서 SOTA를 달성하고, 텍스트 전용 작업에서 치명적인 망각을 겪지 않습니다.
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트와 모든 관련 콘텐츠, 소프트웨어, 제품 및 서비스는 전문 목적 사용을 위한 것입니다. 소비자 사용은 의도되지 않았습니다.