Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
아키텍처
시작하기
결론
star
추천
보도 자료
12월 04, 2025

Jina-VLM: 작은 다국어 비전 언어 모델

새로운 20억 규모의 비전 언어 모델이 다국어 VQA에서 SOTA를 달성하고, 텍스트 전용 작업에서 치명적인 망각을 겪지 않습니다.
Jina AI • 7 분 소요
Jina-VLM: Small Multilingual Vision Language Model
저희는 공개된 2B 규모의 VLM 중에서 최고의 다국어 시각 질의 응답을 달성하는 2.4B 파라미터 시각-언어 모델인 Jina-VLM을 제시합니다. 이 모델은 SigLIP2 시각 인코더와 Qwen3 언어 백본을 임의 해상도 이미지의 토큰 효율적인 처리를 가능하게 하는 어텐션-풀링 커넥터를 통해 결합합니다. 표준 VQA 벤치마크 및 다국어 평가에서 Jina-VLM은 경쟁력 있는 텍스트 전용 성능을 유지하면서 유사한 모델보다 뛰어난 성능을 보입니다.
arXiv.orgAndreas Koukounas
jinaai/jina-vlm · Hugging Face
저희는 오픈 소스 및 오픈 사이언스를 통해 인공 지능을 발전시키고 대중화하기 위한 여정에 있습니다.

저희는 공개된 2B 규모의 VLM 중에서 최고의 다국어 시각 질의 응답을 달성하는 2.4B 파라미터 시각-언어 모델인 jina-vlm을 출시합니다. SigLIP2 시각 인코더와 Qwen3 언어 백본을 어텐션-풀링 커넥터를 통해 결합함으로써 jina-vlm은 소비자 하드웨어에서 실행할 수 있을 만큼 효율성을 유지하면서도 29개 언어에 걸쳐 강력한 성능을 제공합니다.

모델 크기 VQA 평균 MMMB 다국어 MMB DocVQA OCRBench
jina-vlm 2.4B 72.3 78.8 74.3 90.6 778
Qwen2-VL-2B 2.1B 66.4 71.3 69.4 89.2 809
Qwen3-VL-2B 2.8B 71.6 75.0 72.3 92.3 858
InternVL3-2B 2.2B 69.2 73.6 71.9 87.4 835
InternVL3.5-2B 2.2B 71.6 74.6 70.9 88.5 836
MMMB 벤치마크에서 6개 언어(아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어)에 따른 성능 분포. MMMB는 다양한 시각적 질의 유형을 통해 다국어 다중 모드 이해도를 평가합니다.
다국어 MMBench에서 6개 언어(아랍어, 중국어, 영어, 포르투갈어, 러시아어, 터키어)에 따른 성능 분포. 이 벤치마크는 교차 언어 시각적 추론 및 인식 능력을 테스트합니다.
8개의 시각 질의 응답 벤치마크(AI2D(다이어그램), ChartQA(차트), TextVQA(장면 텍스트), DocVQA(문서), InfoVQA(인포그래픽), OCRBench(OCR), SEED-2-Plus(다양한 장면) 및 CharXiv(과학적 그림))에 따른 성능 분포.
3개의 실제 세계 이해 벤치마크(RealWorldQA(실용적인 시나리오), MME-RealWorld(실제 세계 인식) 및 R-Bench(견고성 평가))에 따른 성능 분포.
jina-vlm과 Qwen3-1.7B 백본을 비교하는 5개의 텍스트 전용 벤치마크(MMLU(지식), MMLU-Pro(고급 추론), GSM-8K(수학), ARC-C(과학) 및 HellaSwag(상식))에 따른 성능 분포.

tag아키텍처

jina-vlm의 아키텍처. 이미지는 최대 12개의 겹치는 타일과 전역 썸네일의 격자에 맞게 크기가 조정됩니다. 각 타일은 정사각형 378x378 크롭입니다. 인접한 타일은 112픽셀씩 겹치며 타일 원점 사이의 스트라이드는 266픽셀입니다. 따라서 4x3 격자는 1176x910 픽셀에 걸쳐 있으며, 이 유효 해상도를 초과하는 이미지는 타일 예산에 맞게 축소됩니다. 각 타일은 SigLIP2를 통해 729개의 패치를 생성합니다. VL 커넥터는 24번째 및 18번째 레이어(마지막에서 세 번째 및 아홉 번째)의 특징을 연결한 다음 2x2 어텐션 풀링을 적용하여 729개의 토큰을 182개로 줄인 다음 디코더 차원으로 투영합니다. 시각적 토큰은 Qwen3 디코더를 위해 텍스트 임베딩과 결합됩니다.

두 가지 문제점이 실제 VLM 배포를 제한했습니다. 다국어 기능은 시각 적응 중에 저하되는 경우가 많고, 고품질 VLM은 계산 비용이 많이 듭니다. jina-vlm은 주의 깊은 아키텍처 선택(어텐션-풀링 커넥터는 성능에 미치는 영향이 최소화하면서 시각적 토큰을 4배 줄임)과 다국어 기능을 명시적으로 보존하는 학습 레시피를 통해 이러한 문제를 모두 해결합니다.

핵심적인 아키텍처 혁신은 시각-언어 커넥터입니다. 타일당 729개의 모든 시각적 토큰을 언어 모델에 전달하는 대신 2×2 어텐션 풀링을 적용하여 이를 182개의 토큰으로 줄입니다. 이는 정보 손실을 최소화하면서 4배 감소합니다. 커넥터는 다음과 같이 작동합니다.

  1. 다중 레이어 특징 융합: ViT 레이어 18과 24(마지막에서 세 번째 및 아홉 번째)의 특징을 연결하여 미세한 공간적 디테일과 고급 의미론을 모두 캡처합니다.
  2. 어텐션 풀링: 각 2×2 패치 이웃에 대해 이웃 특징의 평균으로 쿼리를 계산한 다음 교차 어텐션을 적용하여 단일 풀링된 표현을 생성합니다.
  3. SwiGLU 투영: 풀링된 특징은 게이트 선형 단위를 통해 언어 모델 차원으로 투영됩니다.

이 효율성 향상은 아래에 설명되어 있습니다.

메트릭 풀링 없음 풀링 사용 감소
시각적 토큰(12개 타일 + 썸네일) 9,477 2,366 4.0×
LLM 프리필 FLOP 27.2 TFLOP 6.9 TFLOP 3.9×
KV-캐시 메모리 2.12 GB 0.53 GB 4.0×

ViT는 풀링 여부에 관계없이 각 타일을 동일하게 처리하므로 이러한 절감 효과는 추론 중에 지배적인 비용인 언어 모델에만 적용됩니다.

tag학습 절차

VLM 학습의 일반적인 실패 모드는 재앙적 망각입니다. 언어 모델은 시각적 입력에 적응하면서 텍스트 전용 기능을 잃게 됩니다. 이는 특히 비영어권 언어에서 시각 적응이 성능을 저하시킬 수 있는 다국어 모델의 경우에 심각합니다.

저희는 명시적인 다국어 데이터와 텍스트 전용 보존을 통해 2단계 학습 파이프라인을 통해 이를 해결합니다.

1단계: 정렬 학습

첫 번째 단계는 자연 장면, 문서, 인포그래픽 및 다이어그램과 같은 다양한 시각적 도메인에 걸쳐 있는 캡션 데이터 세트를 사용하여 교차 언어 의미론적 접지(grounding)에 중점을 둡니다. 중요한 점은 백본의 언어 이해도를 유지하기 위해 15%의 텍스트 전용 데이터를 포함한다는 것입니다. 커넥터는 인코더 및 디코더보다 더 높은 학습률(2e-4)과 더 짧은 워밍업을 사용하여 사전 훈련된 구성 요소가 점진적으로 변경되는 동안 빠르게 적응할 수 있습니다.

2단계: 명령 미세 조정

두 번째 단계에서는 VQA 및 추론 작업을 위한 명령어 추종을 학습합니다. 언어 능력을 유지하기 위해 학술 VQA, 문서 이해, OCR, 수학 및 추론을 다루는 공개 데이터 세트와 텍스트 전용 명령어 데이터를 결합합니다.

결합된 데이터는 약 5백만 개의 멀티모달 샘플과 29개 언어에 걸쳐 120억 개의 텍스트 词元으로 구성되며, 대략 절반은 영어이고 나머지는 중국어, 아랍어, 독일어, 스페인어, 프랑스어, 이탈리아어, 일본어, 한국어, 포르투갈어, 러시아어, 터키어, 베트남어, 태국어, 인도네시아어, 힌디어, 벵골어 등으로 이루어져 있습니다.

tag시작하기

tagJina API를 통해

https://api-beta-vlm.jina.ai에서 OpenAI 호환 API를 제공합니다.

tagURL에서 이미지 가져오기

형식 예시
HTTP/HTTPS URL https://example.com/image.jpg
Base64 데이터 URI data:image/jpeg;base64,/9j/4AAQ...
curl https://api-beta-vlm.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -d '{
    "model": "jina-vlm",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "Describe this image"},
        {"type": "image_url", "image_url": {"url": "https://example.com/photo.jpg"}}
      ]
    }]
  }'

로컬 이미지 (base64)

curl https://api-beta-vlm.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -d '{
    "model": "jina-vlm",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "What is in this image?"},
        {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,'$(base64 -i image.jpg)'"}}
      ]
    }]
  }'

텍스트 전용 쿼리

curl https://api-beta-vlm.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -d '{
    "model": "jina-vlm",
    "messages": [{"role": "user", "content": "What is the capital of France?"}]
  }'

스트리밍 응답

생성된 词元을 수신하려면 "stream": true를 추가하세요.

curl https://api-beta-vlm.jina.ai/v1/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $JINA_API_KEY" \
  -d '{
    "model": "jina-vlm",
    "stream": true,
    "messages": [{"role": "user", "content": "Write a haiku about coding"}]
  }'

서비스가 콜드 스타트 중인 경우 다음을 받게 됩니다.

{
  "error": {
    "message": "Model is loading, please retry in 30-60 seconds. Cold start takes ~30s after the service scales up.",
    "code": 503
  }
}

잠시 기다린 후 요청을 다시 시도하세요.

tagCLI를 통해

HuggingFace 저장소에는 빠른 실험을 위한 infer.py 스크립트가 포함되어 있습니다.

# Single image
python infer.py -i image.jpg -p "What's in this image?"

# Streaming output
python infer.py -i image.jpg -p "Describe this image" --stream

# Multiple images
python infer.py -i img1.jpg -i img2.jpg -p "Compare these images"

# Text-only
python infer.py -p "What is the capital of France?"

tagTransformers를 통해

from transformers import AutoModelForCausalLM, AutoProcessor
import torch
from PIL import Image

# Load model and processor
model = AutoModelForCausalLM.from_pretrained(
    "jinaai/jina-vlm",
    torch_dtype=torch.bfloat16,
    trust_remote_code=True,
    device_map="auto"
)
processor = AutoProcessor.from_pretrained(
    "jinaai/jina-vlm",
    trust_remote_code=True
)

# Load an image
image = Image.open("document.png")

# Create the conversation
messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": image},
            {"type": "text", "text": "What is the main topic of this document?"}
        ]
    }
]

# Process and generate
inputs = processor.apply_chat_template(
    messages,
    add_generation_prompt=True,
    tokenize=True,
    return_dict=True,
    return_tensors="pt"
).to(model.device)

outputs = model.generate(**inputs, max_new_tokens=256, do_sample=False)
response = processor.decode(outputs[0], skip_special_tokens=True)
print(response)

tag결론

jina-vlm은 작은 VLM이 신중한 아키텍처 및 학습 선택을 통해 강력한 다국어 시각적 이해를 달성할 수 있음을 보여줍니다. 어텐션 풀링 커넥터는 성능에 미치는 영향은 최소화하면서 4배의 词元 감소를 제공하며, 멀티모달 학습 중 텍스트 전용 데이터를 통합하면 저하될 수 있는 언어 능력을 보존합니다.

현재 접근 방식의 몇 가지 제한 사항은 다음과 같습니다.

  • 타일링 오버헤드: 처리는 타일 수에 따라 선형적으로 확장됩니다. 해상도가 매우 높은 이미지의 경우 상당한 오버헤드가 발생할 수 있습니다. 또한 타일링은 객체 개수 세기 또는 타일 경계 전체의 공간적 추론과 같이 전체적인 장면 이해가 필요한 작업을 손상시킬 수 있습니다. 글로벌 썸네일은 이를 부분적으로 완화하지만 기본 해상도 접근 방식이 이러한 작업에 더 적합할 수 있습니다.
  • 다중 이미지 추론: 다중 이미지 벤치마크의 성능은 이 영역의 제한된 학습 데이터로 인해 약합니다. 간결한 시각적 응답에 최적화하는 것은 MMLU-Pro 저하에서 알 수 있듯이 확장된 다단계 추론과 충돌하는 것으로 보입니다.

향후 연구에서는 보다 효율적인 해상도 처리, 개수 세기 및 공간적 작업에 대한 대상 개선 사항을 탐색하고 다국어 학습 레시피가 더 큰 모델 규모로 전송되는지 조사할 수 있습니다.

범주:
star
추천
보도 자료
rss_feed

자세히 보기
8월 03, 2026 • 11 분 소요
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
5월 12, 2026 • 7 분 소요
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
2월 19, 2026 • 7 분 소요
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.