개요
jina-clip-v2는 865M 파라미터 다국어 멀티모달 임베딩 모델로, 89개 언어와 512×512 이미지 입력을 지원합니다. jina-clip-v1을 크로스어설 이미지-텍스트 정렬, 차원 축소를 위한 Matryoshka 표현 학습(1024→64), 시각적으로 풍부한 문서에서의 성능 향상으로 확장합니다. 텍스트 전용 및 단일 모달리티에서 강한 성능을 유지하면서 크로스 언어 이미지 검색에서 state-of-the-art를 달성합니다.
방법
모델은 Jina XLM-RoBERTa 텍스트 인코더(561M 파라미터, 89개 언어, 696,320토큰 컨텍스트)와 EVA02-L14 비전 인코더(304M 파라미터, 512×512 픽셀 입력)를 결합하는 듀얼 인코더 아키텍처를 사용합니다. 학습은 멀티태스크, 멀티스테이지 대비 학습 패러다임을 사용하며: 모델은 텍스트 쌍, 텍스트 트리플릿, 이미지-텍스트 쌍에서 동시에 학습되어 텍스트 전용과 크로스모달 작업 모두를 지원합니다. 학습 데이터셋은 29개 비영어 언어(힌디어, 중국어, 독일어, 프랑스어 포함)의 다국어 텍스트와 시각적으로 풍부한 문서 이미지를 포함하도록 확장되었습니다. Matryoshka 표현 학습을 통해 성능의 99% 이상을 유지하면서 임베딩 차원을 1024에서 64차원으로 축소할 수 있습니다. 모델은 최종 임베딩에 Last-Token-Pooling을 사용합니다.
성능
모델은 Flickr30k 이미지-대-텍스트 검색에서 98.0% 정확도를 달성해 jina-clip-v1과 NLLB-CLIP-SigLIP 모두를 능가합니다. 다국어 시나리오에서 크로스어설 이미지 검색 시 NLLB-CLIP-SigLIP 대비 최대 4% 개선을 보여줍니다. 임베딩 압축은 놀라울 정도로 효과적입니다: 차원을 75% 축소(1024→256)해도 텍스트, 이미지, 크로스모달 작업 전반에 걸쳐 성능의 99% 이상을 유지합니다. Multilingual MTEB에서 검색 69.86%, 의미 유사성 67.77%를 달성해 전문 텍스트 임베딩 모델과 경쟁적인 성능을 보입니다. 89개 언어 지원과 시각적으로 풍부한 문서 처리로 글로벌 이커머스 및 콘텐츠 관리에 특히 적합합니다.
모범 사례
처리 전 이미지를 512×512 픽셀로 리사이즈하세요 — 더 큰 이미지는 자동으로 타일링되어 토큰 사용량과 처리 시간이 증가합니다. 모델은 89개 언어로 이미지를 설명 텍스트와 매칭하는 데 능숙해 글로벌 이커머스 상품 검색, 콘텐츠 추천, 다국어 시각 검색에 이상적입니다. 추상적 개념이나 매우 전문적인 도메인 콘텐츠에서는 어려울 수 있습니다. Matryoshka 차원 축소를 사용할 때, 64차원 임베딩은 인덱싱에 강력한 성능을 유지합니다. 중요 애플리케이션의 리랭킹에는 512+ 차원을 사용하세요. 모델은 CUDA 지원 하드웨어가 필요합니다. 텍스트 전용 워크로드에는 jina-embeddings-v5-text-small이 파라미터당 더 높은 정확도를 제공합니다. 코드 검색에는 jina-code-embeddings-1.5b를 사용하세요. Jina API, AWS, Azure, GCP 마켓플레이스에서 사용 가능합니다.











