I/O 다이어그램 1
I/O 다이어그램 2
I/O 다이어그램 3
I/O 다이어그램 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
값 분포help_outlineAUC 0.9383
코퍼스
번역 쌍
문서 검색
코드
이미지 / 배너
이미지 / 로고
관련83.2%
하드 네거티브24.7%
무관9.3%
권장 컷오프
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
균형 · 0.692
AUC
0.9383
노이즈 상한
0.965
재현율 절벽
0.425
측정 쌍 수
119 / 2,856
순위별 점수help_outline
각 순위 위치의 평균 점수
1위를 차지하는 항목help_outline
119개 질의 중 66%에서 정답이 1위
비교할 모델을 선택하세요
개요
jina-reranker-m0는 여러 언어로 된 시각적 문서의 순위를 매기도록 설계된 획기적인 다중 모달 다국어 재순위 매기기 도구입니다. 이 모델은 29개 언어의 질의를 처리하는 능력과 시각적으로 풍부한 문서 이미지(텍스트, 그래픽, 표 및 다양한 레이아웃이 있는 페이지 포함)를 처리하는 능력이 뛰어납니다. 이 모델은 입력 쿼리와의 관련성에 따라 순위가 매겨진 문서 목록을 출력합니다. "모달리티 갭" 문제(이미지가 다른 이미지 근처에 클러스터링되고 텍스트가 텍스트 근처에 클러스터링되는 문제)에 어려움을 겪었던 이전 재순위 매기기와 달리, jina-reranker-m0는 단일 디코더 전용 모델에서 텍스트 및 시각적 모달리티를 통합하여 이미지와 텍스트 문서를 모두 효율적으로 순위를 매길 수 있는 원활한 다중 모달 검색 환경을 제공합니다.
방법
jina-reranker-m0의 아키텍처는 기존 접근 방식과 크게 다릅니다. 24억 개의 파라미터를 가진 Qwen2-VL-2B를 기반으로 구축된 이 모델은 고전적인 크로스 인코더 아키텍처에서 디코더 전용 비전-언어 모델로 전환했습니다. 이 시스템은 Qwen2-VL의 사전 학습된 비전 인코더와 프로젝터를 활용하고, LoRA(Low-Rank Adaptation)로 대규모 언어 모델을 미세 조정하며, 사후 학습된 MLP를 사용하여 쿼리-문서 관련성을 측정하는 랭킹 로짓을 생성합니다. 이 판별형 모델은 최대 32K 토큰을 처리할 수 있으며 56×56 픽셀부터 4K 해상도까지의 이미지를 지원합니다. 이미지 처리 시 비전 트랜스포머(ViT)와 프로젝터가 인접한 2×2 토큰을 하나의 시각 토큰으로 압축하고, 특수 토큰이 시각 토큰의 경계를 명확히 표시하여 언어 모델이 시각 요소와 텍스트 요소를 올바르게 통합하고 추론할 수 있도록 합니다.
성능
Jina-reranker-m0는 다양한 벤치마크에서 인상적인 결과를 얻었습니다. 텍스트 대 텍스트 재순위 매기기에서는 BEIR 벤치마크에서 NDCG-10 기준 58.95점을 받아 jina-embeddings-v3(55.81) 및 bge-reranker-v2-m3(56.51) 등 경쟁 제품보다 우수한 성과를 보였습니다. 다국어 콘텐츠의 경우 18개 언어를 포괄하는 MIRACL 벤치마크에서 66.75 NDCG-10을 달성했습니다. 긴 문서에 대한 MLDR 벤치마크에서 13개 언어에 걸쳐 59.83 NDCG-10을 달성했습니다. CoIR 벤치마크에서 코드 검색의 경우 63.55 NDCG-10을 달성하여 경쟁 제품보다 훨씬 우수한 성능을 보였습니다. 하지만 이 모델은 시각적 문서 검색에서 진정한 빛을 발합니다. ViDoRe 벤치마크에서 인상적인 NDCG-5 점수 91.02를 달성했고, 시각 언어적 조합 추론을 테스트하는 Winoground에서는 평균 점수 43.92를 달성했습니다. 이는 다른 모델에 비해 텍스트와 이미지 간의 관계를 이해하는 능력이 뛰어나다는 것을 보여줍니다.
모범 사례
jina-reranker-m0의 잠재력을 극대화하려면 개발자는 여러 가지 구현 전략을 고려해야 합니다. 이 모델은 API, 클라우드 서비스 마켓플레이스(AWS, Azure, GCP)를 통해, 또는 Hugging Face를 통해 로컬에서 사용할 수 있습니다. API를 사용하면 개발자는 텍스트 문자열, base64 이미지 또는 이미지 URL을 전달할 수 있으며, 신규 사용자는 1,000만 개의 무료 토큰을 받습니다. 광범위한 훈련 덕분에 이 모델은 텍스트 대 텍스트, 텍스트 대 이미지, 이미지 대 텍스트, 텍스트 대 혼합 단일 모달 작업에서 매우 뛰어난 성능을 보이지만, 일부 조합(예: 이미지 대 이미지)은 별도의 훈련 없이 제로샷 방식으로 지원된다는 점에 유의할 필요가 있습니다. 최상의 결과를 얻으려면 모델이 최대 10K 입력 토큰과 이미지당 최대 768개의 토큰을 지원한다는 점을 명심하세요. 이 아키텍처의 디코더 전용 접근 방식은 단순한 재순위 지정을 넘어 진정한 혼합 모달리티 재순위 지정, 리스트와이즈 재순위 지정, 문서 중복 제거, 어텐션 메커니즘을 통한 순위 점수 해석 가능성 등 기존 인코더 전용 아키텍처에서는 불가능했던 기능을 제공합니다.
이 모델을 언급하는 블로그








