I/O 다이어그램 1

텍스트

jina-clip-v2

벡터

I/O 다이어그램 2

이미지

jina-clip-v2

벡터

파레토 프론트
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2파라미터 수(로그)i2t-recall@5
이 모델
프론트에 있음
Jina AI
기타
CLIP Benchmark
89.73
매개변수
865M
점수 순위
34 / 56
파레토 프론트
프론트 아래
값 분포
AUC 0.8383
코퍼스
번역 쌍
문서 검색
이미지 / 배너
이미지 / 로고
작업
default
retrieval.query
0.6040.000.200.400.60
관련20.2%
하드 네거티브3.6%
무관0.8%
권장 컷오프
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
균형 · 0.403
AUC
0.8383
노이즈 상한
0.666
재현율 절벽
0.224
측정 쌍 수
119 / 11k
벡터 성분
-0.43-0.070.29
σ 0.0313 · 244k 개 값
임베딩 기하 구조
01024
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.420
유효 차원
52 / 1024
언어 쌍
de-ruen-deen-koen-zhja-ko
쌍 간 컷오프 편차: 0.064
비교할 모델을 선택하세요
논문 (2)

개요

jina-clip-v2는 865M 파라미터 다국어 멀티모달 임베딩 모델로, 89개 언어와 512×512 이미지 입력을 지원합니다. jina-clip-v1을 크로스어설 이미지-텍스트 정렬, 차원 축소를 위한 Matryoshka 표현 학습(1024→64), 시각적으로 풍부한 문서에서의 성능 향상으로 확장합니다. 텍스트 전용 및 단일 모달리티에서 강한 성능을 유지하면서 크로스 언어 이미지 검색에서 state-of-the-art를 달성합니다.

방법

모델은 Jina XLM-RoBERTa 텍스트 인코더(561M 파라미터, 89개 언어, 696,320토큰 컨텍스트)와 EVA02-L14 비전 인코더(304M 파라미터, 512×512 픽셀 입력)를 결합하는 듀얼 인코더 아키텍처를 사용합니다. 학습은 멀티태스크, 멀티스테이지 대비 학습 패러다임을 사용하며: 모델은 텍스트 쌍, 텍스트 트리플릿, 이미지-텍스트 쌍에서 동시에 학습되어 텍스트 전용과 크로스모달 작업 모두를 지원합니다. 학습 데이터셋은 29개 비영어 언어(힌디어, 중국어, 독일어, 프랑스어 포함)의 다국어 텍스트와 시각적으로 풍부한 문서 이미지를 포함하도록 확장되었습니다. Matryoshka 표현 학습을 통해 성능의 99% 이상을 유지하면서 임베딩 차원을 1024에서 64차원으로 축소할 수 있습니다. 모델은 최종 임베딩에 Last-Token-Pooling을 사용합니다.

성능

모델은 Flickr30k 이미지-대-텍스트 검색에서 98.0% 정확도를 달성해 jina-clip-v1과 NLLB-CLIP-SigLIP 모두를 능가합니다. 다국어 시나리오에서 크로스어설 이미지 검색 시 NLLB-CLIP-SigLIP 대비 최대 4% 개선을 보여줍니다. 임베딩 압축은 놀라울 정도로 효과적입니다: 차원을 75% 축소(1024→256)해도 텍스트, 이미지, 크로스모달 작업 전반에 걸쳐 성능의 99% 이상을 유지합니다. Multilingual MTEB에서 검색 69.86%, 의미 유사성 67.77%를 달성해 전문 텍스트 임베딩 모델과 경쟁적인 성능을 보입니다. 89개 언어 지원과 시각적으로 풍부한 문서 처리로 글로벌 이커머스 및 콘텐츠 관리에 특히 적합합니다.

모범 사례

처리 전 이미지를 512×512 픽셀로 리사이즈하세요 — 더 큰 이미지는 자동으로 타일링되어 토큰 사용량과 처리 시간이 증가합니다. 모델은 89개 언어로 이미지를 설명 텍스트와 매칭하는 데 능숙해 글로벌 이커머스 상품 검색, 콘텐츠 추천, 다국어 시각 검색에 이상적입니다. 추상적 개념이나 매우 전문적인 도메인 콘텐츠에서는 어려울 수 있습니다. Matryoshka 차원 축소를 사용할 때, 64차원 임베딩은 인덱싱에 강력한 성능을 유지합니다. 중요 애플리케이션의 리랭킹에는 512+ 차원을 사용하세요. 모델은 CUDA 지원 하드웨어가 필요합니다. 텍스트 전용 워크로드에는 jina-embeddings-v5-text-small이 파라미터당 더 높은 정확도를 제공합니다. 코드 검색에는 jina-code-embeddings-1.5b를 사용하세요. Jina API, AWS, Azure, GCP 마켓플레이스에서 사용 가능합니다.

이 모델을 언급하는 블로그
7월 31, 2025 • 12 분 소요
이미지 해상도가 시각 문서 검색에 미치는 영향
이미지 해상도는 시각적으로 풍부한 문서를 벡터 모델 화하는 데 매우 중요합니다. 해상도가 너무 낮으면 모델이 핵심 세부 정보를 놓치고, 너무 높으면 부분을 연결할 수 없습니다.
7월 25, 2025 • 8 분 소요
JinaVDR: 20개 언어로 95개의 태스크를 제공하는 새로운 시각 문서 검색 벤치마크
JinaVDR은 시각 문서 검색을 위한 새로운 벤치마크로, 20개 언어에 걸쳐 95개의 작업을 포함하며 곧 MTEB에서 만나볼 수 있습니다.
6월 25, 2025 • 12 분 소요
Jina Embeddings v4: 멀티모달 다국어 검색을 위한 유니버설 벡터 모델 (Embeddings)
Jina 向量 모델 (Embeddings) v4는 38억 개의 파라미터를 가진 다중 모드 및 다국어 검색을 위한 범용 向量 모델 (embedding model)로, 단일 벡터 및 다중 벡터 向量 모델 (embedding) 출력을 모두 지원합니다.
5월 28, 2025 • 4 분 소요
상관 관계: GUI에서 向量模型 (Embeddings) 분위기 테스트하기
MTEB에 진심인 만큼, 분위기 테스트도 좋아합니다. Correlations는 DeepSearch에서 인용의 유효성을 검사하고, 늦은 청킹을 디버깅하고, 向量模型 (Embeddings)의 분위기를 테스트하는 데 사용하는 간단한 GUI입니다. 이제 오픈 소스입니다.
5월 25, 2025 • 21 분 소요
ICLR2025에서 배운 점
ICLR 2025에서 가장 흥미로운 논문들을 모았습니다. TIPS, FlexPrefill, 제로샷 재정렬기 (Zero-Shot Rerankers), SVD-LLM, Hymba 등이 있습니다.