개요
jina-reranker-m0는 비전-언어 모델 아키텍처에 기반한 2.4B 파라미터의 멀티모달 다국어 리랭커입니다. 여러 언어로 된 시각 문서(텍스트, 그림, 표, 차트)를 처리하는 최초의 리랭커로, ViDoRe(NDCG-5 91.02)와 다국어 장문서 검색(MLDR)에서 SOTA 성능을 달성합니다. 모델은 텍스트-텍스트, 텍스트-이미지, 이미지-텍스트, 혼합 모달리티 리랭커링을 지원합니다.
방법
모델은 디코더 전용 VLM 아키텍처(2.4B 파라미터)로 구축되었으며, DFN CLIP ViT 비전 인코더와 Qwen2 언어 디코더를 결합합니다. 텍스트만 처리하는 전통적 크로스 인코더와 달리, VLM 백본은 텍스트와 이미지 입력을 모두 네이티브로 처리하여, 시각 콘텐츠가 포함된 문서(스캔된 PDF, 인포그래픽, 슬라이드 덱, 삽입 도표가 포함된 표)의 리랭커링을 가능하게 합니다. 10K 토큰 컨텍스트 윈도우는 이미지당 최대 768개 토큰(768×28×28 패치로 처리)을 수용합니다. 훈련은 여러 언어의 다양한 문서 유형에 대해 멀티모달 대비 목적 함수를 사용합니다. 디코더 전용 아키텍처는 리스트와이즈 리랭커링을 가능하게 하고, 문서 중복 제거와 어텐션 메커니즘 기반 랭킹 점수 설명 가능성을 열어줍니다 — 이는 encoder-only 아키텍처에서는 불가능한 기능입니다.
성능
텍스트-텍스트 리랭커링에서, 모델은 BEIR에서 NDCG-10 58.95를 기록하여 jina-embeddings-v3(55.81)와 bge-reranker-v2-m3(56.51)를 상회합니다. 다국어 콘텐츠에서는 MIRACL(18개 언어)에서 NDCG-10 66.75를 달성합니다. 장문서용 MLDR 벤치마크에서는 13개 언어에 걸쳐 NDCG-10 59.83을 기록합니다. 코드 검색은 CoIR에서 NDCG-10 63.55에 도달합니다. 모델은 시각 문서 검색에서 빛을 발합니다: ViDoRe에서 NDCG-5 91.02, Winoground(시각-언어 합성 추론)에서 평균 43.92. 일부 모달리티 조합(예: 이미지-이미지)은 특정 훈련 데이터 없이 제로샷 모드로 지원됩니다.
모범 사례
모델은 Jina API, AWS, Azure, GCP 마켓플레이스를 통해 또는 Hugging Face를 통해 로컬에서 접근할 수 있습니다. API를 사용할 때, 텍스트 문자열, base64 이미지, 또는 이미지 URL을 전달하세요 — 신규 사용자는 10M의 무료 토큰을 받습니다. 모델은 최대 10K 입력 토큰과 이미지당 최대 768개 토큰을 지원합니다. 최적의 결과를 위해, 모델은 텍스트-텍스트, 텍스트-이미지, 이미지-텍스트, 텍스트-혼합 모달리티 작업에서 가장 잘 동작하며, 이미지-이미지는 제로샷입니다. 디코더 전용 아키텍처는 단순한 리랭커링 이상의 기능을 가능하게 합니다: 혼합 모달리티 리랭커링, 리스트와이즈 리랭커링, 문서 중복 제거, 어텐션 기반 랭킹 설명 가능성. 문서가 텍스트 전용 리랭커로는 처리할 수 없는 시각 콘텐츠(스캔된 PDF, 차트, 인포그래픽)를 포함할 때 이 모델을 사용하세요. 더 낮은 비용의 순수 텍스트 리랭커링에는 jina-reranker-v3.5를 사용하세요.








