Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
Embeddings
copyright CC BY-NC 4.0
open_in_new 릴리스 포스트

jina-clip-v2

텍스트와 이미지를 위한 다국어 멀티모달 벡터
라이선스
copyright CC-BY-NC-4.0
출시일
calendar_month
2024-11-05
입력
image
이미지
abc
텍스트
arrow_forward
출력
more_horiz
벡터
Matryoshka 차원 help_outline
64
128
256
512
768
1024
모델 세부정보
매개변수: 865M
입력 토큰 길이: 8K
입력 이미지 크기: 512×512
출력 크기: 1024
기본 모델 help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
훈련된 언어 help_outline
32 언어
지원되는 언어 help_outline
108 언어
관련 모델
link
jina-clip-v1
다음을 통해 이용 가능
Elastic Inference Service
Jina API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
망분리
I/O 다이어그램 1

텍스트

jina-clip-v2

벡터

I/O 다이어그램 2

이미지

jina-clip-v2

벡터

파레토 프론트help_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2파라미터 수(로그)i2t-recall@5
이 모델
프론트에 있음
Jina AI
기타
CLIP Benchmark
89.73
매개변수
865M
점수 순위
34 / 56
파레토 프론트
프론트 아래
값 분포help_outline
AUC 0.8383
코퍼스
번역 쌍
문서 검색
이미지 / 배너
이미지 / 로고
작업
default
retrieval.query
0.6040.000.200.400.60
관련20.2%
하드 네거티브3.6%
무관0.8%
권장 컷오프
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
균형 · 0.403
AUC
0.8383
노이즈 상한
0.666
재현율 절벽
0.224
측정 쌍 수
119 / 11k
벡터 성분help_outline
-0.43-0.070.29
σ 0.0313 · 244k 개 값
임베딩 기하 구조help_outline
01024
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.420
유효 차원
52 / 1024
언어 쌍help_outline
de-ruen-deen-koen-zhja-ko
쌍 간 컷오프 편차: 0.064
비교할 모델을 선택하세요
논문 (2)
ICLR 2026
1월 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
12월 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

개요

jina-clip-v2는 865M 파라미터 다국어 멀티모달 임베딩 모델로, 89개 언어와 512×512 이미지 입력을 지원합니다. jina-clip-v1을 크로스어설 이미지-텍스트 정렬, 차원 축소를 위한 Matryoshka 표현 학습(1024→64), 시각적으로 풍부한 문서에서의 성능 향상으로 확장합니다. 텍스트 전용 및 단일 모달리티에서 강한 성능을 유지하면서 크로스 언어 이미지 검색에서 state-of-the-art를 달성합니다.

방법

모델은 Jina XLM-RoBERTa 텍스트 인코더(561M 파라미터, 89개 언어, 696,320토큰 컨텍스트)와 EVA02-L14 비전 인코더(304M 파라미터, 512×512 픽셀 입력)를 결합하는 듀얼 인코더 아키텍처를 사용합니다. 학습은 멀티태스크, 멀티스테이지 대비 학습 패러다임을 사용하며: 모델은 텍스트 쌍, 텍스트 트리플릿, 이미지-텍스트 쌍에서 동시에 학습되어 텍스트 전용과 크로스모달 작업 모두를 지원합니다. 학습 데이터셋은 29개 비영어 언어(힌디어, 중국어, 독일어, 프랑스어 포함)의 다국어 텍스트와 시각적으로 풍부한 문서 이미지를 포함하도록 확장되었습니다. Matryoshka 표현 학습을 통해 성능의 99% 이상을 유지하면서 임베딩 차원을 1024에서 64차원으로 축소할 수 있습니다. 모델은 최종 임베딩에 Last-Token-Pooling을 사용합니다.

성능

모델은 Flickr30k 이미지-대-텍스트 검색에서 98.0% 정확도를 달성해 jina-clip-v1과 NLLB-CLIP-SigLIP 모두를 능가합니다. 다국어 시나리오에서 크로스어설 이미지 검색 시 NLLB-CLIP-SigLIP 대비 최대 4% 개선을 보여줍니다. 임베딩 압축은 놀라울 정도로 효과적입니다: 차원을 75% 축소(1024→256)해도 텍스트, 이미지, 크로스모달 작업 전반에 걸쳐 성능의 99% 이상을 유지합니다. Multilingual MTEB에서 검색 69.86%, 의미 유사성 67.77%를 달성해 전문 텍스트 임베딩 모델과 경쟁적인 성능을 보입니다. 89개 언어 지원과 시각적으로 풍부한 문서 처리로 글로벌 이커머스 및 콘텐츠 관리에 특히 적합합니다.

모범 사례

처리 전 이미지를 512×512 픽셀로 리사이즈하세요 — 더 큰 이미지는 자동으로 타일링되어 토큰 사용량과 처리 시간이 증가합니다. 모델은 89개 언어로 이미지를 설명 텍스트와 매칭하는 데 능숙해 글로벌 이커머스 상품 검색, 콘텐츠 추천, 다국어 시각 검색에 이상적입니다. 추상적 개념이나 매우 전문적인 도메인 콘텐츠에서는 어려울 수 있습니다. Matryoshka 차원 축소를 사용할 때, 64차원 임베딩은 인덱싱에 강력한 성능을 유지합니다. 중요 애플리케이션의 리랭킹에는 512+ 차원을 사용하세요. 모델은 CUDA 지원 하드웨어가 필요합니다. 텍스트 전용 워크로드에는 jina-embeddings-v5-text-small이 파라미터당 더 높은 정확도를 제공합니다. 코드 검색에는 jina-code-embeddings-1.5b를 사용하세요. Jina API, AWS, Azure, GCP 마켓플레이스에서 사용 가능합니다.

이 모델을 언급하는 블로그
7월 31, 2025 • 12 분 소요
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
7월 25, 2025 • 8 분 소요
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
6월 25, 2025 • 12 분 소요
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
5월 28, 2025 • 4 분 소요
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
5월 25, 2025 • 21 분 소요
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트와 모든 관련 콘텐츠, 소프트웨어, 제품 및 서비스는 전문 목적 사용을 위한 것입니다. 소비자 사용은 의도되지 않았습니다.