Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
warning
이 모델은 최신 모델로 대체되어 더 이상 권장되지 않습니다.
Embeddings
아파치 2.0 라이선스
open_in_new 릴리스 노트

jina-clip-v1

이미지와 영어 텍스트를 위한 멀티모달 벡터 모델
라이선스
Apache-2.0
출시일
calendar_month
2024-06-05
입력
image
이미지
abc
텍스트
arrow_forward
출력
more_horiz
벡터
모델 세부정보
매개변수: 223M
입력 토큰 길이: 8K
입력 이미지 크기: 224×224
출력 크기: 768
기본 모델 help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
훈련된 언어 help_outline
1 언어
관련 모델
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
다음을 통해 이용 가능
Jina API
AWS SageMaker
Microsoft Azure
Hugging Face
망분리
I/O 다이어그램 1

텍스트

jina-clip-v1

벡터

I/O 다이어그램 2

이미지

jina-clip-v1

벡터

파레토 프론트help_outline
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14jina-clip-v2MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v1파라미터 수(로그)i2t-recall@5
이 모델
프론트에 있음
Jina AI
기타
CLIP Benchmark
87.65
파라미터
223M
점수 순위
44 / 56
파레토 프론트
프론트 아래
값 분포help_outline
AUC 0.8440
코퍼스
번역 쌍
문서 검색
이미지 / 배너
0.6750.000.200.400.600.80
관련20.2%
하드 네거티브3.2%
무관1.2%
권장 컷오프
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
균형 · 0.376
AUC
0.8440
노이즈 상한
0.779
재현율 절벽
0.123
측정 쌍 수
119 / 11k
벡터 성분help_outline
-0.18-0.010.15
σ 0.0361 · 183k 개 값
임베딩 기하 구조help_outline
0768
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.283
유효 차원
55 / 768
비교할 모델을 선택하세요
논문 (1)
ICML 2024
5월 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

개요

Jina CLIP v1은 텍스트-텍스트, 텍스트-이미지 검색 작업에서 탁월한 성과를 보인 최초의 모델로, 멀티모달 AI에 혁명을 일으켰습니다. 텍스트 전용 시나리오에서는 성능이 낮은 기존 CLIP 모델과 달리, 제안하는 모델은 2억 2,300만 개의 매개변수로 매우 컴팩트한 크기를 유지하면서 모든 검색 조합에서 최첨단 성능을 달성합니다. 이 모델은 텍스트 및 이미지 처리를 위한 별도의 모델이 필요 없도록 하여 주요 산업 과제를 해결하고, 이를 통해 시스템 복잡성과 계산 오버헤드를 줄입니다. 검색 시스템, 추천 엔진 또는 콘텐츠 분석 도구를 구축하는 팀을 위해 Jina CLIP v1은 매우 높은 정확도로 텍스트 및 시각적 콘텐츠를 처리하는 단일하고 효율적인 솔루션을 제공합니다.

방법

이 모델의 아키텍처는 조정된 Jina BERT v2 텍스트 인코더와 베이징 인공지능 아카데미의 최첨단 EVA-02 이미지 인코더를 결합하여 멀티모달 AI 설계의 주요 혁신을 나타냅니다. 텍스트 인코더는 최대 12,288개 토큰의 시퀀스를 지원합니다. 이는 원래 CLIP의 토큰 제한인 77개보다 100배 이상 길며, 이미지 인코더는 16개 패치 토큰을 효율적으로 처리할 수 있습니다. 훈련 과정은 3단계의 새로운 접근 방식을 따릅니다. 첫째, 텍스트 이해를 유지하면서 끼워 넣은 텍스트 쌍으로 훈련하여 이미지-캡션 쌍을 정렬합니다. 둘째, AI가 생성한 더 긴 이미지 텍스트 설명을 통합합니다. 마지막으로, 의미 판별 능력을 강화하기 위해 하드 네거티브 텍스트 삼중항을 사용합니다. 이 독특한 훈련 접근 방식을 통해 모델은 강력한 시각적 이해력을 유지하는 동시에 짧은 제목과 자세한 텍스트 설명 모두에서 높은 성과를 유지할 수 있습니다.

성능

Jina CLIP v1은 모든 벤치마크에서 OpenAI의 원래 CLIP보다 상당한 개선을 달성했습니다. 일반 텍스트 검색에서는 CLIP의 0.162에 비해 165% 더 높은 0.429의 성적을 기록했습니다. 이미지 관련 작업의 경우 일관된 개선 효과가 나타났습니다. 텍스트-이미지 검색은 2%(0.899), 이미지-텍스트 검색은 6%(0.803), 이미지-이미지 검색은 12%(0.916) 향상되었습니다. 이 모델은 특정 도메인에 대한 사전 훈련 없이도 이미지를 성공적으로 분류하여, 제로샷 시각적 분류 작업에서 특히 좋은 성과를 보입니다. 텍스트 검색을 위한 MTEB, 이미지 작업을 위한 CIFAR-100, 크로스 모달 성능을 위한 Flickr8k/30k 및 MSCOCO 캡션과 같은 표준 벤치마크에서 평가했을 때, 이 제품은 크로스 모달 작업에서 경쟁력 있는 성능을 유지하는 한편, 특화된 단모달 모델보다 지속적으로 우수한 성능을 보였습니다.

모범 사례

Jina CLIP v1을 효과적으로 배포하려면 팀에서는 기능과 리소스 요구 사항을 모두 고려해야 합니다. 이 모델은 224x224픽셀 타일의 이미지를 처리하며, 각 타일은 1,000개의 처리 능력 토큰을 소모합니다. 최상의 성능을 얻으려면 이러한 차원에 맞게 효과적인 이미지 전처리를 구현하세요. 이 모델은 짧은 텍스트와 긴 텍스트를 모두 잘 처리하지만 현재는 영어 입력만 지원합니다. 팀은 토큰 사용을 신중하게 고려해야 합니다. 텍스트는 단어당 약 1.1개의 토큰이 필요한 반면, 이미지는 타일로 처리됩니다(예: 750x500픽셀 이미지는 타일 12개가 필요하므로 12,000개의 토큰을 소모합니다). 이 모델은 Jina Embeddings API를 통해 제공되며, Apache 2.0 라이선스에 따라 Hugging Face에서 오픈 소스로 제공되어 유연한 배포 옵션을 제공합니다. 프로덕션 환경의 경우 최적화된 인프라 설정을 제공하는 AWS Marketplace 또는 Azure 배포 옵션을 사용하는 것이 좋습니다.
이 모델을 언급하는 블로그
6월 25, 2025 • 12 분 소요
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
4월 08, 2025 • 21 분 소요
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
12월 12, 2024 • 12 분 소요
Scaling Test-Time Compute For Embedding Models
Better results scale with compute—more on learning, more on search. A good pretrained model takes you far, but test-time compute takes you further. It's time to recognize this paradigm of test-time compute, even for embedding models.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
12월 04, 2024 • 13 분 소요
Still Need Chunking When Long-Context Models Can Do It All?
Comparing how long-context embedding models perform with different chunking strategies to find the optimal approach for your needs.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
11월 21, 2024 • 9 분 소요
Jina CLIP v2: Multilingual Multimodal Embeddings for Text and Images
Jina-CLIP v2, a 0.9B multimodal embedding model with multilingual support of 89 languages, high image resolution at 512x512, and Matryoshka representations.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.