I/O 다이어그램 1
I/O 다이어그램 2
파레토 프론트help_outline
chevron_leftchevron_right
이 모델
프론트에 있음
Jina AI
기타
CLIP Benchmark
87.65
파라미터
223M
점수 순위
44 / 56
파레토 프론트
프론트 아래
값 분포help_outlineAUC 0.8440
코퍼스
번역 쌍
문서 검색
이미지 / 배너
관련20.2%
하드 네거티브3.2%
무관1.2%
권장 컷오프
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
균형 · 0.376
AUC
0.8440
노이즈 상한
0.779
재현율 절벽
0.123
측정 쌍 수
119 / 11k
벡터 성분help_outline
σ 0.0361 · 183k 개 값
임베딩 기하 구조help_outline
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.283
유효 차원
55 / 768
비교할 모델을 선택하세요
논문 (1)
개요
Jina CLIP v1은 텍스트-텍스트, 텍스트-이미지 검색 작업에서 탁월한 성과를 보인 최초의 모델로, 멀티모달 AI에 혁명을 일으켰습니다. 텍스트 전용 시나리오에서는 성능이 낮은 기존 CLIP 모델과 달리, 제안하는 모델은 2억 2,300만 개의 매개변수로 매우 컴팩트한 크기를 유지하면서 모든 검색 조합에서 최첨단 성능을 달성합니다. 이 모델은 텍스트 및 이미지 처리를 위한 별도의 모델이 필요 없도록 하여 주요 산업 과제를 해결하고, 이를 통해 시스템 복잡성과 계산 오버헤드를 줄입니다. 검색 시스템, 추천 엔진 또는 콘텐츠 분석 도구를 구축하는 팀을 위해 Jina CLIP v1은 매우 높은 정확도로 텍스트 및 시각적 콘텐츠를 처리하는 단일하고 효율적인 솔루션을 제공합니다.
방법
이 모델의 아키텍처는 조정된 Jina BERT v2 텍스트 인코더와 베이징 인공지능 아카데미의 최첨단 EVA-02 이미지 인코더를 결합하여 멀티모달 AI 설계의 주요 혁신을 나타냅니다. 텍스트 인코더는 최대 12,288개 토큰의 시퀀스를 지원합니다. 이는 원래 CLIP의 토큰 제한인 77개보다 100배 이상 길며, 이미지 인코더는 16개 패치 토큰을 효율적으로 처리할 수 있습니다. 훈련 과정은 3단계의 새로운 접근 방식을 따릅니다. 첫째, 텍스트 이해를 유지하면서 끼워 넣은 텍스트 쌍으로 훈련하여 이미지-캡션 쌍을 정렬합니다. 둘째, AI가 생성한 더 긴 이미지 텍스트 설명을 통합합니다. 마지막으로, 의미 판별 능력을 강화하기 위해 하드 네거티브 텍스트 삼중항을 사용합니다. 이 독특한 훈련 접근 방식을 통해 모델은 강력한 시각적 이해력을 유지하는 동시에 짧은 제목과 자세한 텍스트 설명 모두에서 높은 성과를 유지할 수 있습니다.
성능
Jina CLIP v1은 모든 벤치마크에서 OpenAI의 원래 CLIP보다 상당한 개선을 달성했습니다. 일반 텍스트 검색에서는 CLIP의 0.162에 비해 165% 더 높은 0.429의 성적을 기록했습니다. 이미지 관련 작업의 경우 일관된 개선 효과가 나타났습니다. 텍스트-이미지 검색은 2%(0.899), 이미지-텍스트 검색은 6%(0.803), 이미지-이미지 검색은 12%(0.916) 향상되었습니다. 이 모델은 특정 도메인에 대한 사전 훈련 없이도 이미지를 성공적으로 분류하여, 제로샷 시각적 분류 작업에서 특히 좋은 성과를 보입니다. 텍스트 검색을 위한 MTEB, 이미지 작업을 위한 CIFAR-100, 크로스 모달 성능을 위한 Flickr8k/30k 및 MSCOCO 캡션과 같은 표준 벤치마크에서 평가했을 때, 이 제품은 크로스 모달 작업에서 경쟁력 있는 성능을 유지하는 한편, 특화된 단모달 모델보다 지속적으로 우수한 성능을 보였습니다.
모범 사례
Jina CLIP v1을 효과적으로 배포하려면 팀에서는 기능과 리소스 요구 사항을 모두 고려해야 합니다. 이 모델은 224x224픽셀 타일의 이미지를 처리하며, 각 타일은 1,000개의 처리 능력 토큰을 소모합니다. 최상의 성능을 얻으려면 이러한 차원에 맞게 효과적인 이미지 전처리를 구현하세요. 이 모델은 짧은 텍스트와 긴 텍스트를 모두 잘 처리하지만 현재는 영어 입력만 지원합니다. 팀은 토큰 사용을 신중하게 고려해야 합니다. 텍스트는 단어당 약 1.1개의 토큰이 필요한 반면, 이미지는 타일로 처리됩니다(예: 750x500픽셀 이미지는 타일 12개가 필요하므로 12,000개의 토큰을 소모합니다). 이 모델은 Jina Embeddings API를 통해 제공되며, Apache 2.0 라이선스에 따라 Hugging Face에서 오픈 소스로 제공되어 유연한 배포 옵션을 제공합니다. 프로덕션 환경의 경우 최적화된 인프라 설정을 제공하는 AWS Marketplace 또는 Azure 배포 옵션을 사용하는 것이 좋습니다.
이 모델을 언급하는 블로그









