I/O 다이어그램 1
I/O 다이어그램 2
I/O 다이어그램 3
I/O 다이어그램 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
LongEmbed
69.88
Parameters
3.8B
Rank by score
7 / 69
Pareto front
Behind it
값 분포help_outlineAUC 0.8308
코퍼스
번역 쌍
문서 검색
코드
이미지 / 배너
이미지 / 로고
태스크
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
관련6.7%
하드 네거티브1.1%
무관0.8%
권장 컷오프
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
균형 · 0.618
AUC
0.8308
노이즈 상한
0.877
재현율 절벽
0.516
측정 쌍 수
119 / 11k
벡터 성분help_outline
σ 0.0221 · 487k 개 값
임베딩 기하 구조help_outline
차원별 평균, 마우스를 올리면 범위 표시
노이즈 하한
0.496
유효 차원
73 / 2048
차원 절단help_outline
text-matching · 요청 차원 수에 따른 컷오프
언어 쌍help_outline
쌍 간 컷오프 편차: 0.069
비교할 모델을 선택하세요
논문 (2)
개요
Jina Embeddings V4는 통합 텍스트 및 이미지 표현 기능을 제공하는 38억 개의 매개변수를 가진 다중 모달 벡터 모델입니다. Qwen2.5-VL-3B-Instruct 백본 네트워크를 기반으로 하는 이 모델의 아키텍처는 후기 상호작용 방식의 단일 및 다중 벡터를 지원하여 기존 CLIP 스타일 듀얼 인코더 모델의 한계를 극복합니다. 이 모델은 세 가지 작업별 LoRA 어댑터(각각 6천만 개의 매개변수)를 통합하여 고정 백본 네트워크 가중치를 수정하지 않고도 다양한 검색 시나리오(비대칭 쿼리 문서 검색, 의미 텍스트 유사도, 코드 검색 등)에서 성능을 최적화합니다. 이 모델은 통합 처리 경로를 통해 표, 차트, 다이어그램, 스크린샷, 혼합 미디어 형식 등 시각적으로 풍부한 콘텐츠를 처리하는 데 탁월하여 기존 아키텍처에 존재하는 모달리티 격차를 줄입니다. 이 모델은 다국어 기능을 지원하고, 최대 32,768개의 토큰화된 입력 텍스트를 처리하고, 이미지 크기를 최대 20메가픽셀로 조절할 수 있어 다양한 언어와 도메인에 걸친 다양한 문서 검색 및 크로스 모달 검색 애플리케이션에 적합합니다.
방법
Jina Embeddings V4는 CLIP 스타일 듀얼 인코더 접근 방식과는 다른 통합 멀티모달 언어 모델 아키텍처를 구현합니다. 이 모델은 공유 경로를 통해 입력을 처리합니다. 먼저 비전 인코더를 통해 이미지를 토큰 시퀀스로 변환한 다음, 컨텍스트 어텐션 레이어를 갖춘 언어 모델 디코더가 텍스트와 이미지 모달리티를 함께 처리합니다. 이 아키텍처는 다양한 사용 사례를 위해 두 가지 출력 모드를 지원합니다. 단일 벡터 임베딩은 2048차원 벡터를 생성하며 Matryoshka 표현 학습을 통해 128차원까지 잘라낼 수 있고, 효율적인 유사도 검색을 위해 평균 풀링으로 생성됩니다. 다중 벡터 임베딩은 late interaction 방식 검색을 위해 투영 레이어를 통해 토큰당 128차원을 출력합니다. 이 모델은 특화된 최적화를 제공하는 세 가지 작업별 LoRA 어댑터를 포함합니다. 검색 어댑터는 쿼리-문서 시나리오를 위해 접두사 기반 비대칭 인코딩과 하드 네거티브 학습을 사용하고, 텍스트 매칭 어댑터는 의미 유사도 작업을 위해 CoSENT 손실을 사용하며, 코드 어댑터는 자연어-코드 검색 애플리케이션에 중점을 둡니다. 학습은 두 단계로 진행됩니다. 300개 이상의 소스에서 얻은 텍스트-텍스트 및 텍스트-이미지 쌍에 대해 대조적 InfoNCE 손실을 사용하는 초기 페어 학습을 수행하고, 이어서 트리플릿 기반 방법과 각 도메인의 요구 사항에 맞춘 특수 손실 함수를 사용하여 세 개의 LoRA 어댑터를 작업별로 미세 조정합니다.
성능
Jina Embeddings V4는 여러 벤치마크 범주에서 매우 경쟁력 있는 성능을 달성했습니다. 시각 문서 검색에서는 JinaVDR 벤치마크에서 평균 72.19점을 기록했는데, 이는 ColPali-v1.2의 64.50점과 비교되는 수치입니다. ViDoRe 벤치마크에서는 평균 84.11점을 기록했는데, 이는 ColPali의 83.90점과 비교되는 수치입니다. 또한 다중 벡터 모드의 경우 ViDoRe 벤치마크에서 90.17점을 기록했습니다. 교차 모달 검색에서는 CLIP 벤치마크에서 84.11점을 기록했는데, 이는 jina-clip-v2의 81.12점, nllb-clip-large-siglip의 83.19점과 비교되는 수치입니다. 텍스트 검색 작업에서 MTEB-en에서는 55.97점, MMTEB에서는 66.49점을 기록했으며, LongEmbed에서는 이전 모델인 55.66점에 비해 67.11점을 기록하며 장문 문서 검색에서도 탁월한 성능을 보였습니다. 이 모델은 영어 STS 작업에서 85.89점, 다국어 STS 벤치마크에서 72.70점을 기록하며 탄탄한 의미 텍스트 유사도 성능을 보여주었습니다. 코드 검색 성능은 CoIR 벤치마크에서 71.59점을 기록했지만, voyage-code-3(77.33)와 같은 특수 모델이 이 영역에서 더 높은 점수를 받았습니다. 이 모델의 교차 모달 정렬 성능은 OpenAI CLIP의 0.15점보다 0.71점으로 향상되어 다중 모달 모델의 모달리티 갭 문제를 해결했습니다. 시각적으로 풍부한 작업에서 다중 벡터 모드는 단일 벡터 모드보다 지속적으로 우수한 성능을 보였으며, 단일 벡터 모드는 표준 검색 시나리오에서 효율적인 성능을 제공했습니다.
모범 사례
Jina Embeddings V4를 효과적으로 사용하려면 특정 애플리케이션 요구 사항에 따라 적합한 LoRA 어댑터를 선택하세요. 쿼리와 문서 구조가 다른 비대칭 쿼리-문서 검색 시나리오의 경우, retrieval 어댑터를 사용하고 쿼리와 단락 내용을 구분하기 위해 적절한 접두사를 사용하세요. text-matching 어댑터는 의미적 유사성 작업 및 대칭 검색에 적합하며, 쿼리에 대한 답변보다는 유사한 콘텐츠를 찾는 것이 목표이므로 문서 클러스터링, 중복 감지 및 콘텐츠 추천 시스템에 적합합니다. 프로그래밍 관련 애플리케이션의 경우, code 어댑터는 자연어-코드 검색, 코드 간 유사성 검색 및 기술적인 질의응답 시나리오에 최적화되어 있습니다. 성능 및 효율성 요구 사항에 따라 출력 모드를 선택하세요. 단일 벡터 임베딩은 효율적인 유사성 검색을 제공하고 저장 공간이 제한된 환경에 적합하며, 차원을 2048에서 128~512로 잘라내면서도 품질 저하를 허용 가능한 수준으로 유지할 수 있습니다. 반면 다중 벡터 임베딩은 복잡한 검색 작업, 특히 시각적으로 풍부한 문서를 처리할 때 더 높은 정확도를 제공하며, 이러한 경우 후기 상호작용 스코어링이 세부적인 관계를 포착합니다. 이 모델의 통합 아키텍처는 별도의 인코더나 시각적 문서의 OCR 전처리 없이 혼합된 텍스트와 이미지 입력을 처리할 수 있도록 합니다. 이 모델은 교차 모달 정렬 기능과 다국어 지원을 통해 국제적인 애플리케이션에 적합합니다. 프로덕션 배포의 경우, 메모리 요구 사항을 계획할 때 LoRA 어댑터당 6,000만 개의 매개변수 오버헤드를 고려해야 하며, 세 개의 어댑터를 모두 추가 메모리 사용량 2% 미만으로 동시에 유지할 수 있어 추론 중 유연한 작업 전환이 가능합니다.
이 모델을 언급하는 블로그
Qwen 연구 라이센스 









