개요
jina-clip-v1는 223M 파라미터 멀티모달 임베딩 모델로, 텍스트-대-텍스트와 텍스트-대-이미지 검색 모두에서 state-of-the-art 성능을 달성했습니다 — CLIP 계열 모델로는 최초입니다. 크로스모달 정렬을 위해 텍스트 전용 검색을 희생하는 표준 CLIP 모델과 달리, jina-clip-v1은 멀티태스크 대비 학습을 사용해 모든 검색 조합에서 강한 성능을 유지합니다. 텍스트 컨텍스트 12,288토큰을 지원하며, 원래 CLIP의 77토큰 제한의 100배입니다.
방법
아키텍처는 ALiBi로 12,288토큰을 지원하는 수정된 Jina BERT v2 텍스트 인코더와 Beijing Academy for AI의 EVA-02 이미지 인코더를 결합합니다. 핵심 혁신은 멀티태스크 대비 학습 방법입니다: 모델은 (1) 크로스모달 정렬을 위한 이미지-캡션 쌍, (2) 텍스트 전용 검색 품질을 유지하기 위한 텍스트-텍스트 쌍, (3) 다양한 텍스트 길이에 대한 강건성을 높이기 위한 이미지의 AI 생성 더 긴 텍스트 설명에서 동시에 학습됩니다. 최종 단계에서는 하드 네거티브 텍스트 트리플릿을 사용해 의미적 구분을 더 날카롭게 합니다. 이 멀티태스크 접근법은 표준 CLIP 학습을 괴롭히는 텍스트 전용 검색의 재난적 망각(catastrophic forgetting)을 방지합니다. 이미지 인코더는 224×224 픽셀 타일을 처리하며, 각 타일은 1,000토큰의 처리 용량을 소비합니다.
성능
텍스트 전용 검색에서 이 모델은 OpenAI CLIP 대비 165% 성능 향상을 달성했습니다(MTEB에서 0.429 대 0.162). 이미지 작업: 텍스트-대-이미지 검색 2% 향상(0.899), 이미지-대-텍스트 검색 6%(0.803), 이미지-대-이미지 검색 12%(0.916). 제로샷 시각 분류(CIFAR-100)에서는 표준 CLIP보다 우수합니다. Flickr8k/30k와 MSCOCO Captions의 크로스모달 성능은 전문 단일 모달리티 모델과 경쟁적입니다. 12,288토큰 텍스트 컨텍스트는 이미지와 함께 긴 형식의 텍스트 문서를 검색하는 데 주요한 이점입니다. 2026년, jina-clip-v2가 89개 언어 지원과 512×512 이미지 처리로 이 모델을 대체합니다.
모범 사례
모델은 224×224 픽셀 타일로 이미지를 처리합니다. 각 타일은 1,000토큰을 소비합니다. 750×500 픽셀 이미지는 12개 타일(12,000토큰)이 필요합니다. 텍스트는 단어당 약 1.1토큰가 필요합니다. 멀티모달 쿼리에 대해 토큰 예산을 상응하게 계획하세요. 모델은 현재 영어만 지원합니다 — 다국어 애플리케이션에는 jina-clip-v2를 사용하세요. Jina Embeddings API와 Hugging Face의 Apache 2.0 라이선스 오픈소스 릴리스로 사용할 수 있습니다. 프로덕션 환경에서는 AWS Marketplace와 Azure 배포 옵션이 최적화된 인프라를 제공합니다. 크로스모달 비교에는 코사인 유사도를 사용하세요. 새로운 멀티모달 프로젝트에는 jina-clip-v2(89개 언어, 512×512 이미지, MRL 지원) 또는 jina-embeddings-v4(32K 컨텍스트, 멀티벡터 모드, 코드 지원)를 우선 사용하세요.









