여러분이 스포츠 뉴스 검색 시스템을 구축하고 있다고 상상해 보세요. 사용자가 "테니스 선수권 대회 우승을 축하하는 테니스 선수들"을 검색하고 데이터베이스에서 가장 관련성이 높은 기사를 찾아야 합니다. 각 기사에는 텍스트 캡션과 이미지가 모두 포함되어 있습니다. 이는 현대 스포츠 보도의 일반적인 특징입니다.
여러분의 시스템은 텍스트 쿼리를 받아 코퍼스에서 가장 관련성이 높은 멀티모달 문서의 순위가 매겨진 목록을 반환해야 합니다. 간단하게 들리지만, 모든 명백한 접근 방식을 무너뜨리는 근본적인 문제가 있습니다.
이러한 문서의 순위를 매기려고 할 때 발생하는 상황은 다음과 같습니다. 여러분의 向量模型 (Embedding) 모델인 jina-clip-v2는 다음과 같은 유사도 점수를 생성합니다.
| 기사 | 콘텐츠 유형 | 설명 | 유사도 점수 |
|---|---|---|---|
| A | 텍스트 | 노박 조코비치가 호주 오픈 결승에서 스트레이트 세트로 승리 | 0.72 |
| A | 이미지 | [트로피를 들고 웃고 있는 선수의 사진] | 0.31 |
| B | 텍스트 | 날씨 지연으로 인해 야외 토너먼트 일정에 차질 | 0.23 |
| B | 이미지 | [점프하고 축하하는 테니스 선수들의 사진] | 0.54 |
어떤 기사가 더 관련성이 높을까요? 기사 A는 텍스트 점수는 높지만 이미지 점수는 낮습니다. 기사 B는 텍스트 점수는 낮지만 이미지 점수는 더 높습니다. 근본적인 문제는 0.72(텍스트)와 0.54(이미지)를 비교할 수 없다는 것입니다. 왜냐하면 이러한 유사도 점수는 완전히 다른 척도에 존재하기 때문입니다.
tag사소한 해결 방법이 실패하는 경우
jina-clip-v2 또는 거의 모든 다른 CLIP 유사 모델의 양식 격차 때문에 시도할 수 있는 명백한 접근 방식은 작동하지 않습니다. 더 높은 점수를 사용하면 텍스트 점수는 0.2-0.8 주위에, 이미지 점수는 0.4-0.6 주위에 모인다는 사실에 직면하게 됩니다. 즉, 평범한 텍스트 일치(0.6)는 항상 뛰어난 이미지 일치(0.5)를 이깁니다.
점수를 평균화하는 것도 도움이 되지 않습니다. (0.7 + 0.3)/2 = 0.5를 계산하면 숫자가 나오지만 실제로 무엇을 의미할까요? 근본적으로 의미 없는 양을 평균화하는 것입니다. 마찬가지로, 고정 가중치 체계는 임의적입니다. 때로는 텍스트가 더 중요하고 때로는 이미지가 더 중요하며, 이는 특정 쿼리 및 문서에 따라 완전히 달라집니다.
점수를 먼저 정규화하더라도 핵심 문제는 해결되지 않습니다. 여전히 관련성의 다른 측면을 캡처하는 근본적으로 다른 유사성 측정값을 결합하려고 시도하는 것입니다.
tag실제로 일어나는 일

우리가 무엇을 다루고 있는지 더 잘 이해하기 위해 EDIS 데이터 세트의 예제 문서를 보여드리겠습니다. 여기에는 이미지(독일 축구 경기)와 캡션(One More Field Where the Content Trails Germany)이 있습니다.

전반적으로 jina-clip-v2는 모델이 훈련된 방식과 데이터 세트 자체 때문에 EDIS 데이터 세트에서 쿼리-텍스트를 비교할 때 쿼리-이미지보다 훨씬 더 높은 유사성을 보입니다.

따라서 텍스트가 아닌 이미지를 기반으로 문서를 검색하는 것이 논리적으로 보입니다. 그리고 아래 그림에서 볼 수 있듯이 ... for undocumented immigrants helping to establish legal status in the United States 텍스트 쿼리를 코퍼스의 텍스트 내용과 비교하면 훨씬 더 나은 결과를 얻을 수 있습니다. 실제로 이미지로 검색하면 정답 문서(노란색으로 강조 표시됨)를 전혀 검색하지 못합니다.

top_k가 3일 때 jina-clip-v2의 쿼리-텍스트 검색을 통해서만 정답 문서(노란색 테두리로 강조 표시됨)를 검색할 수 있는 예입니다.하지만 속지 마세요. 쿼리-텍스트가 더 높은 유사도 점수를 보여주더라도 쿼리-텍스트 및 쿼리-이미지 유사도 점수는 비교할 수 없습니다. jina-clip-v2를 사용하여 EDIS 데이터 세트에서 32개의 문서를 검색할 때 recall@10을 살펴보면 이를 알 수 있습니다. 분명히 리콜은 쿼리-이미지에서 더 높습니다.
| Recall@10 | |
|---|---|
| 쿼리-텍스트 | 14.55 |
| 쿼리-이미지 | 22.38 |
아래에서 볼 수 있듯이 데이터 세트에서 쿼리 Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi.를 사용하는 경우 이미지 콘텐츠를 통해서만 정답 문서를 검색할 수 있습니다. 텍스트 콘텐츠로 검색하면 일치하는 항목이 반환되지 않습니다.

top_k가 3일 때 jina-clip-v2의 쿼리-이미지 검색을 통해서만 정답 문서(노란색 테두리로 강조 표시됨)를 검색할 수 있는 예입니다.따라서 유사도 점수가 텍스트에서 문서를 검색해야 함을 암시하고, 재현율이 이미지에서 문서를 검색해야 함을 암시한다면, 무엇을 선택해야 할까요? 분명히 그림 3과 4는 명확한 승자가 없음을 보여줍니다. 어떤 양식 (modality) 이 정말로 쿼리와 우리가 찾고 있는 문서 사이의 가장 가까운 일치 항목을 나타낼까요? 그리고 쿼리-텍스트 및 쿼리-이미지 검색 모두에서 후보를 병합하고 싶다면 점수를 비교할 수조차 없다면 어떻게 의미 있게 상위 일치 항목을 선택할 수 있을까요? 분명히 jina-clip-v2만으로는 충분하지 않습니다. 다른 모델을 믹스에 투입해야 합니다.
tag간단한 2단계 파이프라인
2025년 4월에 시각적 문서를 검색하기 위한 다국어 멀티모달 재정렬기 (Reranker)인 jina-reranker-m0를 출시했습니다. 아래에서 jina-reranker-m0가 쿼리-텍스트 및 쿼리-이미지 유사도 점수를 비슷하게 보여주는 더 좁은 양식 간 격차를 볼 수 있습니다. 이는 jina-clip-v2에서 보이는 훨씬 더 넓은 격차와 대조됩니다.

이 점을 염두에 두고 jina-clip-v2에서 초기 결과를 검색한 후 검색 체인에서 두 번째 패스에 jina-reranker-m0를 사용할 수 있습니다.
1단계: 양식 (Modality) 모두에서 후보 검색
- jina-clip-v2를 사용하여 텍스트 검색을 통해 16개의 문서 + 이미지 검색을 통해 16개의 문서 가져오기
- 아직 점수를 비교할 수 없음을 인정
2단계: 통합 재정렬
- 각 (쿼리 + 전체 문서) 쌍을 jina-reranker-m0에 공급
- 재정렬기는 텍스트와 이미지를 함께 처리
- 출력: 통합된 스케일의 단일 관련성 점수

테이블 1의 실험을 확장하여 이제 jina-clip-v2를 사용하여 코퍼스에서 문서를 검색한 다음 jina-reranker-m0를 사용하여 재정렬합니다.
- 쿼리-텍스트를 통해 32개의 문서를 검색한 다음 쿼리-텍스트 점수를 기준으로 재정렬합니다.
- 쿼리-이미지를 통해 32개의 문서를 검색한 다음 쿼리-이미지 점수를 기준으로 재정렬합니다.
- 쿼리-텍스트를 통해 16개의 문서를 검색하고 쿼리-이미지를 통해 16개의 문서를 검색합니다. 쿼리 양식 (modality)에 따라 쿼리-텍스트 또는 쿼리-이미지 점수를 기준으로 재정렬합니다.
- 쿼리-텍스트를 통해 16개의 문서를 검색하고 쿼리-이미지를 통해 16개의 문서를 검색합니다. 각 문서의 평균 쿼리-텍스트 및 쿼리-이미지 점수를 기준으로 재정렬하여 최종 점수는 (쿼리-텍스트 + 쿼리-이미지)/2가 됩니다.
| 실험 | 설명 | jina-clip-v2 사용 시 Recall@10 | jina-reranker-m0 사용 시 Recall@10 |
|---|---|---|---|
| 1 | 32개 문서: 쿼리-텍스트 | 14.55 | 17.42 |
| 2 | 32개 문서: 쿼리-이미지 | 22.38 | 28.94 |
| 3 | 16개 문서: 쿼리-텍스트 16개 문서: 쿼리-이미지 |
14.55 | 33.81 |
| 4 | 16개 문서: 쿼리-텍스트 16개 문서: 쿼리-이미지 결합된 평균 재정렬기 (Reranker) 점수 |
14.55 | 36.24 |
보시다시피 jina-reranker-m0를 사용하여 두 번째 패스를 수행하면 양식 (modality)에 관계없이 전체적으로 재현율이 증가합니다. 그러나 검색된 문서의 텍스트 및 이미지 콘텐츠를 모두 결합할 때 가장 큰 증가를 볼 수 있으며, recall@10은 36.24에 도달합니다. 시각적 예는 jina-reranker-m0가 텍스트 또는 이미지 콘텐츠를 검색하든 일관되게 실제 근거 (ground truth) 문서를 1위로 평가한다는 것을 보여줍니다.

top_k (오른쪽의 4개 열)은 이미지 및 텍스트 유사도 점수를 결합하면 일관되게 실제 근거 (ground truth) 문서를 1위로 평가합니다.top_k가 3인 반면, 공간상의 이유로 그림 7은 각 쿼리에 대해 top_k가 1인 경우만 보여줍니다.tag결론
이 간단한 2단계 접근 방식은 시스템이 마침내 인간이 자연스럽게 하는 것, 즉 관련성을 결정하기 위해 읽는 것과 보는 것을 모두 고려하기 때문에 재현율이 62% 향상됩니다. 교훈은 검색을 넘어 확장됩니다. 멀티모달 AI 시스템을 처리할 때 양식 (modality)을 개별적으로 처리하는 단일 패스 접근 방식은 항상 이 점수 비호환성 문제에 부딪힐 것입니다. 광범위하게 검색한 다음 지능적으로 순위를 매기는 2단계 아키텍처가 필수가 되고 있습니다. API 또는 AWS, GCP 및 Azure를 통해 jina-reranker-m0를 사용해 보십시오.









