I/O 다이어그램 1

다중

텍스트

텍스트

jina-reranker-m0

랭킹

I/O 다이어그램 2

다중

이미지

텍스트

jina-reranker-m0

랭킹

I/O 다이어그램 3

다중

텍스트

이미지

jina-reranker-m0

랭킹

I/O 다이어그램 4

다중

이미지

이미지

jina-reranker-m0

랭킹

파레토 프론트
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…파라미터 수(로그)nDCG@5
이 모델
프론트에 있음
Jina AI
기타
ViDoRe v1
91.02
매개변수
2.4B
점수 순위
7 / 24
파레토 프론트
프론트 아래
값 분포
AUC 0.9383
코퍼스
번역 쌍
문서 검색
코드
이미지 / 배너
이미지 / 로고
0.7120.200.400.600.801.00
관련83.2%
하드 네거티브24.7%
무관9.3%
권장 컷오프
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
균형 · 0.692
AUC
0.9383
노이즈 상한
0.965
재현율 절벽
0.425
측정 쌍 수
119 / 2,856
순위별 점수
12345678910
각 순위 위치의 평균 점수
1위를 차지하는 항목
119개 질의 중 66%에서 정답이 1위
비교할 모델을 선택하세요

개요

jina-reranker-m0는 비전-언어 모델 아키텍처에 기반한 2.4B 파라미터의 멀티모달 다국어 리랭커입니다. 여러 언어로 된 시각 문서(텍스트, 그림, 표, 차트)를 처리하는 최초의 리랭커로, ViDoRe(NDCG-5 91.02)와 다국어 장문서 검색(MLDR)에서 SOTA 성능을 달성합니다. 모델은 텍스트-텍스트, 텍스트-이미지, 이미지-텍스트, 혼합 모달리티 리랭커링을 지원합니다.

방법

모델은 디코더 전용 VLM 아키텍처(2.4B 파라미터)로 구축되었으며, DFN CLIP ViT 비전 인코더와 Qwen2 언어 디코더를 결합합니다. 텍스트만 처리하는 전통적 크로스 인코더와 달리, VLM 백본은 텍스트와 이미지 입력을 모두 네이티브로 처리하여, 시각 콘텐츠가 포함된 문서(스캔된 PDF, 인포그래픽, 슬라이드 덱, 삽입 도표가 포함된 표)의 리랭커링을 가능하게 합니다. 10K 토큰 컨텍스트 윈도우는 이미지당 최대 768개 토큰(768×28×28 패치로 처리)을 수용합니다. 훈련은 여러 언어의 다양한 문서 유형에 대해 멀티모달 대비 목적 함수를 사용합니다. 디코더 전용 아키텍처는 리스트와이즈 리랭커링을 가능하게 하고, 문서 중복 제거와 어텐션 메커니즘 기반 랭킹 점수 설명 가능성을 열어줍니다 — 이는 encoder-only 아키텍처에서는 불가능한 기능입니다.

성능

텍스트-텍스트 리랭커링에서, 모델은 BEIR에서 NDCG-10 58.95를 기록하여 jina-embeddings-v3(55.81)와 bge-reranker-v2-m3(56.51)를 상회합니다. 다국어 콘텐츠에서는 MIRACL(18개 언어)에서 NDCG-10 66.75를 달성합니다. 장문서용 MLDR 벤치마크에서는 13개 언어에 걸쳐 NDCG-10 59.83을 기록합니다. 코드 검색은 CoIR에서 NDCG-10 63.55에 도달합니다. 모델은 시각 문서 검색에서 빛을 발합니다: ViDoRe에서 NDCG-5 91.02, Winoground(시각-언어 합성 추론)에서 평균 43.92. 일부 모달리티 조합(예: 이미지-이미지)은 특정 훈련 데이터 없이 제로샷 모드로 지원됩니다.

모범 사례

모델은 Jina API, AWS, Azure, GCP 마켓플레이스를 통해 또는 Hugging Face를 통해 로컬에서 접근할 수 있습니다. API를 사용할 때, 텍스트 문자열, base64 이미지, 또는 이미지 URL을 전달하세요 — 신규 사용자는 10M의 무료 토큰을 받습니다. 모델은 최대 10K 입력 토큰과 이미지당 최대 768개 토큰을 지원합니다. 최적의 결과를 위해, 모델은 텍스트-텍스트, 텍스트-이미지, 이미지-텍스트, 텍스트-혼합 모달리티 작업에서 가장 잘 동작하며, 이미지-이미지는 제로샷입니다. 디코더 전용 아키텍처는 단순한 리랭커링 이상의 기능을 가능하게 합니다: 혼합 모달리티 리랭커링, 리스트와이즈 리랭커링, 문서 중복 제거, 어텐션 기반 랭킹 설명 가능성. 문서가 텍스트 전용 리랭커로는 처리할 수 없는 시각 콘텐츠(스캔된 PDF, 차트, 인포그래픽)를 포함할 때 이 모델을 사용하세요. 더 낮은 비용의 순수 텍스트 리랭커링에는 jina-reranker-v3.5를 사용하세요.

이 모델을 언급하는 블로그
10월 03, 2025 • 7 분 소요
Jina Reranker v3: SOTA 다국어 검색을 위한 0.6B Listwise 재정렬기
쿼리 및 모든 후보 문서를 단일 컨텍스트 창에서 고려하는 새로운 0.6B 파라미터 목록별 재정렬기(Reranker)입니다.
8월 13, 2025 • 15 분 소요
디코더 전용 벡터 모델용 GGUF 최적화
L4 GPU에서 30억 개의 파라미터를 가진 向量模型이 llama.cpp로 초당 4000 词元을 처리하는 속도는 아마도 최대한으로 빠른 속도일 것입니다. 정말 그럴까요?
7월 14, 2025 • 11 분 소요
텍스트 선택, Passage Reranking 및 컨텍스트 엔지니어링을 위한 Submodular 최적화
다른 사람들이 프롬프트 튜닝에 의존하며 최선을 바라기만 할 때, 여러분은 더 나은 컨텍스트 엔지니어링을 위해 이론적 보장이 뒷받침되는 원칙적인 프레임워크를 제공하는 부분 모듈 최적화(submodular optimization)를 배워야 합니다.
6월 25, 2025 • 12 분 소요
Jina Embeddings v4: 멀티모달 다국어 검색을 위한 유니버설 벡터 모델 (Embeddings)
Jina 向量 모델 (Embeddings) v4는 38억 개의 파라미터를 가진 다중 모드 및 다국어 검색을 위한 범용 向量 모델 (embedding model)로, 단일 벡터 및 다중 벡터 向量 모델 (embedding) 출력을 모두 지원합니다.
5월 25, 2025 • 8 분 소요
jina-reranker-m0으로 멀티모달 문서에 대한 공정한 점수 매기기
텍스트 유사성: 0.7. 이미지 유사성: 0.5. 어떤 문서가 더 관련성이 높을까요? 말 그대로 알 수 없습니다. 이것이 바로 멀티모달 검색을 망치는 핵심 문제입니다. 당사는 통합 재정렬 (Reranking)로 이 문제를 해결합니다.