I/O 다이어그램 1
I/O 다이어그램 2
값 분포help_outlineAUC 0.8383
코퍼스
번역 쌍
문서 검색
이미지 / 배너
이미지 / 로고
태스크
default
retrieval.query
관련20.2%
하드 네거티브3.6%
무관0.8%
차트에 마우스를 올리거나 클릭하면 컷오프가 이동합니다
권장 컷오프
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
균형 · 0.403
AUC
0.8383
노이즈 상한
0.666
재현율 절벽
0.224
측정 쌍 수
119 / 11k
벡터 성분help_outline
σ 0.0313 · 244k 개 값
임베딩 기하 구조help_outline
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.420
유효 차원
52 / 1024
언어 쌍help_outline
쌍 간 컷오프 편차: 0.064
비교할 모델을 선택하세요
논문 (2)
개요
Jina CLIP v2는 89개 언어에 대해 시각적 이해와 텍스트 이해 간의 격차를 메워 멀티모달 AI에 혁신을 불러옵니다. 이 모델은 언어 장벽에 관계없이 정확한 이미지-텍스트 매칭을 달성하여 글로벌 전자상거래, 콘텐츠 관리 및 문화 간 소통의 주요 과제를 해결합니다. 국제적으로 사업을 확장하거나 다국어 콘텐츠를 관리하는 기업의 경우, 각 언어에 대한 별도의 모델이나 복잡한 번역 프로세스가 필요 없습니다. 이 모델은 글로벌 시장 제품 발견이나 다국어 디지털 자산 관리와 같이 언어 경계를 넘나드는 정확한 시각적 검색이 필요한 시나리오에서 특히 뛰어납니다.
방법
Jina CLIP v2의 핵심은 Jina XLM-RoBERTa 텍스트 인코더(561M 매개변수)와 EVA02-L14 시각적 인코더(304M 매개변수)를 결합한 정교한 듀얼 인코더 아키텍처입니다. 텍스트 인코더는 696,320개 토큰으로 구성된 대규모 컨텍스트 창을 사용하여 89개 언어의 콘텐츠를 처리하는 반면, 시각적 인코더는 최대 512x512픽셀의 고해상도 이미지를 처리합니다. 이 모델은 성능을 유지하면서도 1024차원에서 64차원으로 동적 벡터 차원 조정을 가능하게 하는 혁신적인 마트료시카 표현 학습을 도입했습니다. 이 아키텍처는 텍스트와 이미지를 자체 인코더를 통해 처리하여, 원래 양식이나 언어에 관계없이 유사한 개념을 정렬할 수 있는 공유된 의미 공간에 투사합니다.
성능
이 모델은 Flickr30k 이미지-텍스트 검색 작업에서 98.0%의 정확도로 최첨단 성능을 달성하여 이전 버전과 NLLB-CLIP-SigLIP를 모두 능가했습니다. 다국어 시나리오에서는 가장 큰 경쟁 모델보다 매개변수가 적음에도 교차 언어 이미지 검색 작업에서 NLLB-CLIP-SigLIP 대비 최대 4%의 향상을 보여줍니다. 임베딩이 압축되어도 강력한 성능을 유지하여, 차원을 75% 줄여도 텍스트, 이미지, 크로스 모달 작업 전반에서 성능의 99% 이상이 보존됩니다. 종합적인 Multilingual MTEB 벤치마크에서는 검색 69.86%, 의미 유사도 작업 67.77%를 달성하여 특화된 텍스트 임베딩 모델과 견줄 만한 성능을 보였습니다.
모범 사례
최적의 배포를 위해 사용자는 몇 가지 핵심 요소를 고려해야 합니다. 이 모델은 효율적인 처리를 위해 CUDA 지원 하드웨어가 필요하고, 메모리 요구 사항은 배치 크기와 이미지 해상도에 따라 확장됩니다. API 비용과 성능을 최적화하려면 처리하기 전에 이미지 크기를 512x512 픽셀로 조정하세요. 더 큰 이미지는 자동으로 타일링되어 토큰 사용량과 처리 시간이 늘어납니다. 이 모델은 여러 언어에서 이미지와 설명적 텍스트를 매칭하는 데 능숙하지만, 추상적인 개념이나 매우 전문화된 분야별 콘텐츠를 처리하는 데 어려움이 있을 수 있습니다. 이 기술은 전자상거래 제품 검색, 콘텐츠 추천 시스템, 시각적 검색 애플리케이션에 특히 효과적이지만, 세부적인 시각적 세부 정보나 고도로 특화된 도메인 전문 지식을 분석해야 하는 작업에는 적합하지 않을 수 있습니다. 마트료시카를 사용하여 특징을 표현할 때 차원 축소와 성능 간의 균형을 고려하세요. 64차원 벡터가 강력한 성능을 유지하지만, 중요한 애플리케이션은 더 높은 차원이 필요할 수 있습니다.
이 모델을 언급하는 블로그















