Elastic
Jina AI
모델
API
keyboard_arrow_down
Reader
어떤 URL이든 Markdown으로 변환하여 LLM 그라운딩을 개선하세요.
Embeddings
멀티모달 및 다국어 임베딩.
Reranker
검색 관련성을 극대화하는 리랭커.
Elastic Inference Service
Jina 모델을 Elasticsearch에서 네이티브 방식으로 실행하세요.
MCP
terminal
CLI
article
llms.txt
smart_toy
에이전트
data_object
스키마
menu_book
문서
로그인
login
사소한 해결 방법이 실패하는 경우
실제로 일어나는 일
간단한 2단계 파이프라인
결론
기술 블로그
5월 25, 2025

jina-reranker-m0으로 멀티모달 문서에 대한 공정한 점수 매기기

텍스트 유사성: 0.7. 이미지 유사성: 0.5. 어떤 문서가 더 관련성이 높을까요? 말 그대로 알 수 없습니다. 이것이 바로 멀티모달 검색을 망치는 핵심 문제입니다. 당사는 통합 재정렬 (Reranking)로 이 문제를 해결합니다.
Nan Wang, Alex C-G • 8 분 소요

여러분이 스포츠 뉴스 검색 시스템을 구축하고 있다고 상상해 보세요. 사용자가 "테니스 선수권 대회 우승을 축하하는 테니스 선수들"을 검색하고 데이터베이스에서 가장 관련성이 높은 기사를 찾아야 합니다. 각 기사에는 텍스트 캡션과 이미지가 모두 포함되어 있습니다. 이는 현대 스포츠 보도의 일반적인 특징입니다.

여러분의 시스템은 텍스트 쿼리를 받아 코퍼스에서 가장 관련성이 높은 멀티모달 문서의 순위가 매겨진 목록을 반환해야 합니다. 간단하게 들리지만, 모든 명백한 접근 방식을 무너뜨리는 근본적인 문제가 있습니다.

이러한 문서의 순위를 매기려고 할 때 발생하는 상황은 다음과 같습니다. 여러분의 向量模型 (Embedding) 모델인 jina-clip-v2는 다음과 같은 유사도 점수를 생성합니다.

기사 콘텐츠 유형 설명 유사도 점수
A 텍스트 노박 조코비치가 호주 오픈 결승에서 스트레이트 세트로 승리 0.72
A 이미지 [트로피를 들고 웃고 있는 선수의 사진] 0.31
B 텍스트 날씨 지연으로 인해 야외 토너먼트 일정에 차질 0.23
B 이미지 [점프하고 축하하는 테니스 선수들의 사진] 0.54

어떤 기사가 더 관련성이 높을까요? 기사 A는 텍스트 점수는 높지만 이미지 점수는 낮습니다. 기사 B는 텍스트 점수는 낮지만 이미지 점수는 더 높습니다. 근본적인 문제는 0.72(텍스트)와 0.54(이미지)를 비교할 수 없다는 것입니다. 왜냐하면 이러한 유사도 점수는 완전히 다른 척도에 존재하기 때문입니다.

tag사소한 해결 방법이 실패하는 경우

CLIP 모델에서 텍스트-이미지 양식 격차의 원인과 이유
CLIP 모델을 사용하여 텍스트와 이미지를 검색하고 점수별로 결과를 정렬할 수는 없습니다. 왜일까요? 양식 격차 때문입니다. 이것은 무엇이며, 어디에서 오는 것일까요?
Jina AIBo Wang, Scott Martens

jina-clip-v2 또는 거의 모든 다른 CLIP 유사 모델의 양식 격차 때문에 시도할 수 있는 명백한 접근 방식은 작동하지 않습니다. 더 높은 점수를 사용하면 텍스트 점수는 0.2-0.8 주위에, 이미지 점수는 0.4-0.6 주위에 모인다는 사실에 직면하게 됩니다. 즉, 평범한 텍스트 일치(0.6)는 항상 뛰어난 이미지 일치(0.5)를 이깁니다.

점수를 평균화하는 것도 도움이 되지 않습니다. (0.7 + 0.3)/2 = 0.5를 계산하면 숫자가 나오지만 실제로 무엇을 의미할까요? 근본적으로 의미 없는 양을 평균화하는 것입니다. 마찬가지로, 고정 가중치 체계는 임의적입니다. 때로는 텍스트가 더 중요하고 때로는 이미지가 더 중요하며, 이는 특정 쿼리 및 문서에 따라 완전히 달라집니다.

점수를 먼저 정규화하더라도 핵심 문제는 해결되지 않습니다. 여전히 관련성의 다른 측면을 캡처하는 근본적으로 다른 유사성 측정값을 결합하려고 시도하는 것입니다.

tag실제로 일어나는 일

EDIS: 멀티모달 웹 콘텐츠에 대한 엔티티 기반 이미지 검색
실제 검색 애플리케이션에 이미지 검색 방법을 적용하려면 데이터 세트 규모, 엔티티 이해 및 멀티모달 정보 융합에서 상당한 진전이 필요합니다. 이 연구에서는 뉴스 도메인에서 교차 모달 이미지 검색을 위한 도전적인 데이터 세트인 \textbf{E}ntity-\textbf{D}riven \textbf{I}mage \textbf{S}earch(EDIS)를 소개합니다. EDIS는 실제 검색 엔진 결과 및 선별된 데이터 세트에서 가져온 100만 개의 웹 이미지로 구성되며, 각 이미지는 텍스트 설명과 쌍을 이룹니다. 단일 모달 후보의 작은 세트를 가정하는 데이터 세트와 달리 EDIS는 100만 개의 멀티모달 이미지-텍스트 쌍을 후보로 포함하여 실제 웹 이미지 검색 시나리오를 반영합니다. EDIS는 교차 모달 정보 융합 및 매칭을 동시에 처리하는 검색 모델의 개발을 장려합니다. 정확한 순위 결과를 얻으려면 모델은 1) 텍스트 쿼리에서 명명된 엔티티 및 이벤트를 이해하고, 2) 엔티티를 이미지 또는 텍스트 설명에 연결하고, 3) 텍스트 및 시각적 표현을 효과적으로 융합해야 합니다. 우리의 실험 결과는 EDIS가 밀집된 엔티티와 대규모 후보 세트로 최첨단 방법을 어렵게 만든다는 것을 보여줍니다. 제거 연구는 또한 검색 결과를 개선하는 데 텍스트 특징과 시각적 특징을 융합하는 것이 중요하다는 것을 증명합니다.
arXiv.orgSiqi Liu

우리가 무엇을 다루고 있는지 더 잘 이해하기 위해 EDIS 데이터 세트의 예제 문서를 보여드리겠습니다. 여기에는 이미지(독일 축구 경기)와 캡션(One More Field Where the Content Trails Germany)이 있습니다.

그림 1: 이미지 및 텍스트 콘텐츠를 모두 포함하는 멀티모달 문서의 예입니다. 두 가지 양식이 있으므로 주어진 쿼리에 대해 이제 두 개의 의미론적 격차가 있습니다(쿼리와 텍스트 사이, 쿼리와 이미지 사이). 최상의 결과를 얻으려면 문서의 텍스트 콘텐츠를 검색해야 할까요, 아니면 이미지 콘텐츠를 검색해야 할까요?

전반적으로 jina-clip-v2는 모델이 훈련된 방식과 데이터 세트 자체 때문에 EDIS 데이터 세트에서 쿼리-텍스트를 비교할 때 쿼리-이미지보다 훨씬 더 높은 유사성을 보입니다.

그림 2: jina-clip-v2를 사용하여 쿼리-이미지(빨간색)와 쿼리-텍스트(파란색) 간의 유사도 점수입니다.

따라서 텍스트가 아닌 이미지를 기반으로 문서를 검색하는 것이 논리적으로 보입니다. 그리고 아래 그림에서 볼 수 있듯이 ... for undocumented immigrants helping to establish legal status in the United States 텍스트 쿼리를 코퍼스의 텍스트 내용과 비교하면 훨씬 더 나은 결과를 얻을 수 있습니다. 실제로 이미지로 검색하면 정답 문서(노란색으로 강조 표시됨)를 전혀 검색하지 못합니다.

그림 3: top_k가 3일 때 jina-clip-v2의 쿼리-텍스트 검색을 통해서만 정답 문서(노란색 테두리로 강조 표시됨)를 검색할 수 있는 예입니다.

하지만 속지 마세요. 쿼리-텍스트가 더 높은 유사도 점수를 보여주더라도 쿼리-텍스트 및 쿼리-이미지 유사도 점수는 비교할 수 없습니다. jina-clip-v2를 사용하여 EDIS 데이터 세트에서 32개의 문서를 검색할 때 recall@10을 살펴보면 이를 알 수 있습니다. 분명히 리콜은 쿼리-이미지에서 더 높습니다.

Recall@10
쿼리-텍스트 14.55
쿼리-이미지 22.38

아래에서 볼 수 있듯이 데이터 세트에서 쿼리 Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi.를 사용하는 경우 이미지 콘텐츠를 통해서만 정답 문서를 검색할 수 있습니다. 텍스트 콘텐츠로 검색하면 일치하는 항목이 반환되지 않습니다.

그림 4: top_k가 3일 때 jina-clip-v2의 쿼리-이미지 검색을 통해서만 정답 문서(노란색 테두리로 강조 표시됨)를 검색할 수 있는 예입니다.

따라서 유사도 점수가 텍스트에서 문서를 검색해야 함을 암시하고, 재현율이 이미지에서 문서를 검색해야 함을 암시한다면, 무엇을 선택해야 할까요? 분명히 그림 3과 4는 명확한 승자가 없음을 보여줍니다. 어떤 양식 (modality) 이 정말로 쿼리와 우리가 찾고 있는 문서 사이의 가장 가까운 일치 항목을 나타낼까요? 그리고 쿼리-텍스트 및 쿼리-이미지 검색 모두에서 후보를 병합하고 싶다면 점수를 비교할 수조차 없다면 어떻게 의미 있게 상위 일치 항목을 선택할 수 있을까요? 분명히 jina-clip-v2만으로는 충분하지 않습니다. 다른 모델을 믹스에 투입해야 합니다.

tag간단한 2단계 파이프라인

2025년 4월에 시각적 문서를 검색하기 위한 다국어 멀티모달 재정렬기 (Reranker)인 jina-reranker-m0를 출시했습니다. 아래에서 jina-reranker-m0가 쿼리-텍스트 및 쿼리-이미지 유사도 점수를 비슷하게 보여주는 더 좁은 양식 간 격차를 볼 수 있습니다. 이는 jina-clip-v2에서 보이는 훨씬 더 넓은 격차와 대조됩니다.

그림 6: jina-clip-v2와 비교하여 jina-reranker-m0는 쿼리-이미지 (빨간색) 및 쿼리-텍스트 (파란색) 유사도 점수 간의 차이가 훨씬 적습니다.

이 점을 염두에 두고 jina-clip-v2에서 초기 결과를 검색한 후 검색 체인에서 두 번째 패스에 jina-reranker-m0를 사용할 수 있습니다.

1단계: 양식 (Modality) 모두에서 후보 검색

  • jina-clip-v2를 사용하여 텍스트 검색을 통해 16개의 문서 + 이미지 검색을 통해 16개의 문서 가져오기
  • 아직 점수를 비교할 수 없음을 인정

2단계: 통합 재정렬

  • 각 (쿼리 + 전체 문서) 쌍을 jina-reranker-m0에 공급
  • 재정렬기는 텍스트와 이미지를 함께 처리
  • 출력: 통합된 스케일의 단일 관련성 점수
그림 5: jina-clip-v2 및 jina-reranker-m0를 사용한 멀티모달 문서 인덱싱 및 2단계 멀티모달 검색 프로세스.

테이블 1의 실험을 확장하여 이제 jina-clip-v2를 사용하여 코퍼스에서 문서를 검색한 다음 jina-reranker-m0를 사용하여 재정렬합니다.

  1. 쿼리-텍스트를 통해 32개의 문서를 검색한 다음 쿼리-텍스트 점수를 기준으로 재정렬합니다.
  2. 쿼리-이미지를 통해 32개의 문서를 검색한 다음 쿼리-이미지 점수를 기준으로 재정렬합니다.
  3. 쿼리-텍스트를 통해 16개의 문서를 검색하고 쿼리-이미지를 통해 16개의 문서를 검색합니다. 쿼리 양식 (modality)에 따라 쿼리-텍스트 또는 쿼리-이미지 점수를 기준으로 재정렬합니다.
  4. 쿼리-텍스트를 통해 16개의 문서를 검색하고 쿼리-이미지를 통해 16개의 문서를 검색합니다. 각 문서의 평균 쿼리-텍스트 및 쿼리-이미지 점수를 기준으로 재정렬하여 최종 점수는 (쿼리-텍스트 + 쿼리-이미지)/2가 됩니다.
💡
EDIS에서 제로샷 성능을 측정하고 있습니다. 데이터 세트를 사용하여 jina-clip-v2 또는 jina-reranker-m0를 미세 조정하지 않았습니다.
실험 설명 jina-clip-v2 사용 시 Recall@10 jina-reranker-m0 사용 시 Recall@10
1 32개 문서: 쿼리-텍스트 14.55 17.42
2 32개 문서: 쿼리-이미지 22.38 28.94
3 16개 문서: 쿼리-텍스트
16개 문서: 쿼리-이미지
14.55 33.81
4 16개 문서: 쿼리-텍스트
16개 문서: 쿼리-이미지
결합된 평균 재정렬기 (Reranker) 점수
14.55 36.24
💡
실험 1, 3 및 4는 쿼리-텍스트 점수가 쿼리-이미지 점수보다 높기 때문에 jina-clip-v2에서 recall@10에 대해 동일한 결과를 보여줍니다. 따라서 상위 10개 결과는 텍스트를 통해 검색된 문서가 지배합니다.

보시다시피 jina-reranker-m0를 사용하여 두 번째 패스를 수행하면 양식 (modality)에 관계없이 전체적으로 재현율이 증가합니다. 그러나 검색된 문서의 텍스트 및 이미지 콘텐츠를 모두 결합할 때 가장 큰 증가를 볼 수 있으며, recall@10은 36.24에 도달합니다. 시각적 예는 jina-reranker-m0가 텍스트 또는 이미지 콘텐츠를 검색하든 일관되게 실제 근거 (ground truth) 문서를 1위로 평가한다는 것을 보여줍니다.

그림 7: 샘플 쿼리 (왼쪽) 및 각 재정렬 방법론에 대한 1개의 결과의 top_k (오른쪽의 4개 열)은 이미지 및 텍스트 유사도 점수를 결합하면 일관되게 실제 근거 (ground truth) 문서를 1위로 평가합니다.
💡
그림 3과 4는 다양한 검색 방법에 대한 top_k가 3인 반면, 공간상의 이유로 그림 7은 각 쿼리에 대해 top_k가 1인 경우만 보여줍니다.

tag결론

이 간단한 2단계 접근 방식은 시스템이 마침내 인간이 자연스럽게 하는 것, 즉 관련성을 결정하기 위해 읽는 것과 보는 것을 모두 고려하기 때문에 재현율이 62% 향상됩니다. 교훈은 검색을 넘어 확장됩니다. 멀티모달 AI 시스템을 처리할 때 양식 (modality)을 개별적으로 처리하는 단일 패스 접근 방식은 항상 이 점수 비호환성 문제에 부딪힐 것입니다. 광범위하게 검색한 다음 지능적으로 순위를 매기는 2단계 아키텍처가 필수가 되고 있습니다. API 또는 AWS, GCP 및 Azure를 통해 jina-reranker-m0를 사용해 보십시오.

범주:
기술 블로그
rss_feed

자세히 보기
3월 11, 2026 • 7 분 소요
Bootstrapping Audio Embeddings from Multimodal LLMs
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
3월 06, 2026 • 6 분 소요
Identifying Embedding Models from Raw Numerical Values
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
9월 09, 2025 • 11 분 소요
Multimodal Embeddings in Llama.cpp and GGUF
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
현재 언어 / 테마
Search Foundation
Reader
Embeddings
Reranker
Jina API 키 받기
속도 제한
회사 소개
소식
Jina 로고 다운로드
open_in_new
Elastic 로고 다운로드
open_in_new
API 상태
Elastic © 2026.보안이용약관개인정보 보호쿠키 관리제 개인 정보를 판매하거나 공유하지 마세요.
본 웹사이트 및 관련 콘텐츠, 소프트웨어, 제품, 서비스는 전문가용으로만 제작되었습니다. 일반 소비자를 위한 것이 아니며, 소비자의 사용을 권장하지 않습니다.