Elastic
Jina AI
소식
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP terminalCLIarticlellms.txtsmart_toy에이전트data_object스키마menu_book문서



로그인
login
Embeddings
copyright CC BY-NC 4.0
open_in_new 릴리스 노트

jina-clip-v2

텍스트와 이미지를 위한 다국어 멀티모달 벡터
라이선스
copyright CC-BY-NC-4.0
출시일
calendar_month
2024-11-05
입력
image
이미지
abc
텍스트
arrow_forward
출력
more_horiz
벡터
Matryoshka 차원 help_outline
64
128
256
512
768
1024
모델 세부정보
매개변수: 865M
입력 토큰 길이: 8K
입력 이미지 크기: 512×512
출력 크기: 1024
기본 모델 help_outline
open_in_new
XLM-RoBERTa Large
훈련된 언어 help_outline
32 언어
지원되는 언어 help_outline
108 언어
관련 모델
link
jina-clip-v1
다음을 통해 이용 가능
Elastic Inference Service
Jina API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
망분리
I/O 다이어그램 1

텍스트

jina-clip-v2

벡터

I/O 다이어그램 2

이미지

jina-clip-v2

벡터

값 분포help_outline
AUC 0.8383
코퍼스
번역 쌍
문서 검색
이미지 / 배너
이미지 / 로고
태스크
default
retrieval.query
0.6040.000.200.400.60
관련20.2%
하드 네거티브3.6%
무관0.8%
차트에 마우스를 올리거나 클릭하면 컷오프가 이동합니다
권장 컷오프
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
균형 · 0.403
AUC
0.8383
노이즈 상한
0.666
재현율 절벽
0.224
측정 쌍 수
119 / 11k
벡터 성분help_outline
-0.43-0.070.29
σ 0.0313 · 244k 개 값
임베딩 기하 구조help_outline
01024
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.420
유효 차원
52 / 1024
언어 쌍help_outline
de-ruen-deen-koen-zhja-ko
쌍 간 컷오프 편차: 0.064
비교할 모델을 선택하세요
논문 (2)
ICLR 2026
1월 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
12월 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

개요

Jina CLIP v2는 89개 언어에 대해 시각적 이해와 텍스트 이해 간의 격차를 메워 멀티모달 AI에 혁신을 불러옵니다. 이 모델은 언어 장벽에 관계없이 정확한 이미지-텍스트 매칭을 달성하여 글로벌 전자상거래, 콘텐츠 관리 및 문화 간 소통의 주요 과제를 해결합니다. 국제적으로 사업을 확장하거나 다국어 콘텐츠를 관리하는 기업의 경우, 각 언어에 대한 별도의 모델이나 복잡한 번역 프로세스가 필요 없습니다. 이 모델은 글로벌 시장 제품 발견이나 다국어 디지털 자산 관리와 같이 언어 경계를 넘나드는 정확한 시각적 검색이 필요한 시나리오에서 특히 뛰어납니다.

방법

Jina CLIP v2의 핵심은 Jina XLM-RoBERTa 텍스트 인코더(561M 매개변수)와 EVA02-L14 시각적 인코더(304M 매개변수)를 결합한 정교한 듀얼 인코더 아키텍처입니다. 텍스트 인코더는 696,320개 토큰으로 구성된 대규모 컨텍스트 창을 사용하여 89개 언어의 콘텐츠를 처리하는 반면, 시각적 인코더는 최대 512x512픽셀의 고해상도 이미지를 처리합니다. 이 모델은 성능을 유지하면서도 1024차원에서 64차원으로 동적 벡터 차원 조정을 가능하게 하는 혁신적인 마트료시카 표현 학습을 도입했습니다. 이 아키텍처는 텍스트와 이미지를 자체 인코더를 통해 처리하여, 원래 양식이나 언어에 관계없이 유사한 개념을 정렬할 수 있는 공유된 의미 공간에 투사합니다.

성능

이 모델은 Flickr30k 이미지-텍스트 검색 작업에서 98.0%의 정확도로 최첨단 성능을 달성하여 이전 버전과 NLLB-CLIP-SigLIP를 모두 능가했습니다. 다국어 시나리오에서는 가장 큰 경쟁 모델보다 매개변수가 적음에도 교차 언어 이미지 검색 작업에서 NLLB-CLIP-SigLIP 대비 최대 4%의 향상을 보여줍니다. 임베딩이 압축되어도 강력한 성능을 유지하여, 차원을 75% 줄여도 텍스트, 이미지, 크로스 모달 작업 전반에서 성능의 99% 이상이 보존됩니다. 종합적인 Multilingual MTEB 벤치마크에서는 검색 69.86%, 의미 유사도 작업 67.77%를 달성하여 특화된 텍스트 임베딩 모델과 견줄 만한 성능을 보였습니다.

모범 사례

최적의 배포를 위해 사용자는 몇 가지 핵심 요소를 고려해야 합니다. 이 모델은 효율적인 처리를 위해 CUDA 지원 하드웨어가 필요하고, 메모리 요구 사항은 배치 크기와 이미지 해상도에 따라 확장됩니다. API 비용과 성능을 최적화하려면 처리하기 전에 이미지 크기를 512x512 픽셀로 조정하세요. 더 큰 이미지는 자동으로 타일링되어 토큰 사용량과 처리 시간이 늘어납니다. 이 모델은 여러 언어에서 이미지와 설명적 텍스트를 매칭하는 데 능숙하지만, 추상적인 개념이나 매우 전문화된 분야별 콘텐츠를 처리하는 데 어려움이 있을 수 있습니다. 이 기술은 전자상거래 제품 검색, 콘텐츠 추천 시스템, 시각적 검색 애플리케이션에 특히 효과적이지만, 세부적인 시각적 세부 정보나 고도로 특화된 도메인 전문 지식을 분석해야 하는 작업에는 적합하지 않을 수 있습니다. 마트료시카를 사용하여 특징을 표현할 때 차원 축소와 성능 간의 균형을 고려하세요. 64차원 벡터가 강력한 성능을 유지하지만, 중요한 애플리케이션은 더 높은 차원이 필요할 수 있습니다.
이 모델을 언급하는 블로그
11월 21, 2024 • 9 분 소요
Jina CLIP v2: 텍스트와 이미지를 위한 다국어 멀티모달 임베딩
Jina-CLIP v2는 89개 언어를 지원하는 다국어 기능, 512x512의 고해상도 이미지 처리, 그리고 Matryoshka 표현을 갖춘 0.9B 규모의 멀티모달 임베딩 모델입니다.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
6월 05, 2024 • 9 분 소요
Jina CLIP v1: 텍스트와 이미지를 위한 진정한 멀티모달 임베딩 모델
Jina AI의 새로운 멀티모달 임베딩 모델은 텍스트-이미지 검색에서 OpenAI CLIP을 능가할 뿐만 아니라, 동시에 뛰어난 이미지 임베딩 모델이자 최첨단 텍스트 임베딩 모델입니다. 더 이상 서로 다른 모달리티에 대해 각각 다른 모델이 필요하지 않습니다.
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
10월 29, 2024 • 11 분 소요
CLIP을 넘어서: Jina-CLIP이 멀티모달 검색을 발전시키는 방법
OpenAI의 CLIP을 개선하여 통합된 텍스트-이미지 임베딩을 통해 더 나은 검색 정확도와 다양한 결과를 제공하는 Jina-CLIP에 대해 알아보세요.
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
8월 30, 2024 • 10 분 소요
Jina ColBERT v2: 임베딩과 재순위화를 위한 다국어 후기 상호작용 검색기
Jina ColBERT v2는 89개 언어를 지원하며, 우수한 검색 성능과 사용자 제어 가능한 출력 차원, 그리고 8192 토큰 길이를 제공합니다.
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
6월 25, 2024 • 15 분 소요
Agentic RAG를 위한 Jina Reranker v2: 초고속, 다국어, 함수 호출 & 코드 검색
Jina Reranker v2는 Agentic RAG를 위해 만들어진 최고 수준의 리랭커입니다. 함수 호출 지원, 100개 이상 언어에 대한 다국어 검색 기능, 코드 검색 기능을 제공하며, v1보다 6배 더 빠른 속도를 제공합니다.
Saahil Ognawala
Jie Fu
Yuting Zhang
Scott Martens
Black background with word 'RERANKER' in white at left and a stylized white question mark design at the right.
Search Foundation
Reader
Embeddings
Reranker
Elastic Inference Service
open_in_new
Jina API 키 받기
속도 제한
API 상태
약관
보안
이용약관
개인정보 보호
쿠키 관리
제 개인 정보를 판매하거나 공유하지 마세요.
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
Elastic © 2020-2026.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.