Grafico I/O 1

multiplo

Testo

Testo

jina-reranker-m0

Classifica

Grafico I/O 2

multiplo

Immagine

Testo

jina-reranker-m0

Classifica

Grafico I/O 3

multiplo

Testo

Immagine

jina-reranker-m0

Classifica

Grafico I/O 4

multiplo

Immagine

Immagine

jina-reranker-m0

Classifica

Frontiera di Pareto
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parametri (log)nDCG@5
Questo modello
Sulla frontiera
Jina AI
Altri
ViDoRe v1
91.02
Parametri
2.4B
Classifica per punteggio
7 / 24
Frontiera di Pareto
Dietro
Distribuzione dei valori
AUC 0.9383
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
0.7120.200.400.600.801.00
Correlate83.2%
Negativo difficile24.7%
Non correlate9.3%
Soglie consigliate
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
bilanciata · 0.692
AUC
0.9383
Soglia del rumore
0.965
Crollo del richiamo
0.425
Coppie misurate
119 / 2.856
Punteggio per posizione
12345678910
Punteggio medio a ogni posizione
Chi vince la prima posizione
Una corrispondenza corretta vince il 66% di 119 query
Scegli i modelli da confrontare

Panoramica

jina-reranker-m0 è un reranker multimodale multilingue da 2,4B parametri basato su un'architettura di modello vision-language. È il primo reranker a gestire documenti visivi (testo, figure, tabelle, grafici) in più lingue, raggiungendo performance state-of-the-art su ViDoRe (91,02 NDCG-5) e sul retrieval di documenti lunghi multilingue (MLDR). Il modello supporta il reranking text-to-text, text-to-image, image-to-text e a modalità mista.

Metodi

Il modello è costruito su un'architettura VLM decoder-only (2,4B parametri) che combina un vision encoder DFN CLIP ViT con un decoder di linguaggio Qwen2. A differenza dei cross-encoder tradizionali che elaborano solo testo, il backbone VLM gestisce nativamente sia input di testo che di immagine, abilitando il reranking di documenti che contengono contenuto visivo (PDF scansionati, infografiche, presentazioni, tabelle con figure incorporate). La finestra di contesto di 10K token accoglie fino a 768 token per immagine (elaborati come patch 768×28×28). L'addestramento usa un obiettivo contrastivo multimodale su diversi tipi di documento in più lingue. L'architettura decoder-only abilita il reranking listwise e apre possibilità di deduplicazione dei documenti e spiegabilità dei punteggi di ranking tramite meccanismi di attenzione — capacità non disponibili con architetture encoder-only.

Prestazione

Nel reranking text-to-text, il modello ottiene 58,95 NDCG-10 su BEIR, superando jina-embeddings-v3 (55,81) e bge-reranker-v2-m3 (56,51). Per il contenuto multilingue, raggiunge 66,75 NDCG-10 su MIRACL (18 lingue). Sul benchmark MLDR per documenti lunghi, ottiene 59,83 NDCG-10 su 13 lingue. Il retrieval di codice raggiunge 63,55 NDCG-10 su CoIR. Il modello brilla nel retrieval di documenti visivi: 91,02 NDCG-5 su ViDoRe e 43,92 di media su Winoground (ragionamento composizionistico visiolinguistico). Alcune combinazioni di modalità (ad es. image-to-image) sono supportate in modalità zero-shot senza dati di addestramento specifici.

Orientamento

Il modello è accessibile tramite l'API Jina, i marketplace AWS, Azure e GCP, o localmente tramite Hugging Face. Quando si usa l'API, passare stringhe di testo, immagini base64 o URL di immagini — gli utenti nuovi ricevono 10M token gratuiti. Il modello supporta fino a 10K token di input con fino a 768 token per immagine. Per risultati ottimali, il modello ha le performance migliori sui task text-to-text, text-to-image, image-to-text e text-to-modalità mista; image-to-image è zero-shot. L'architettura decoder-only abilita capacità oltre il semplice reranking: reranking a modalità mista, reranking listwise, deduplicazione dei documenti e spiegabilità del ranking basata su attenzione. Usa questo modello quando i tuoi documenti contengono contenuto visivo (PDF scansionati, grafici, infografiche) che i reranker solo testo non possono gestire. Per il reranking di testo puro a costo inferiore, usa jina-reranker-v3.5.

Blog che menzionano questo modello
ottobre 03, 2025 • 7 minuti letti
Jina Reranker v3: Reranker Listwise da 0.6B per il recupero multilingue SOTA
Nuovo *reranker* *listwise* da 0.6 miliardi di parametri che considera la query e tutti i documenti candidati in una singola finestra di contesto.
agosto 13, 2025 • 15 minuti letti
Ottimizzazione dei GGUF per i modelli di Embeddings solo decoder
Ottenere 4000 token/sec per un modello di 向量模型 da 3 miliardi di parametri su GPU L4 è probabilmente il massimo che si possa ottenere con llama.cpp. O forse no?
luglio 14, 2025 • 11 minuti letti
Ottimizzazione submodulare per la selezione di testo, il Reranking di passaggi e l'ingegneria del contesto
Mentre altri si affidano all'ottimizzazione dei Prompt e sperano per il meglio, dovresti imparare l'ottimizzazione submodulare che fornisce un framework basato su principi con garanzie teoriche per una migliore ingegneria del contesto.
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: 向量模型 (Embeddings) universali per il recupero multimodale multilingue
Jina Embeddings v4 è un modello di 向量模型 (Embeddings) universale da 3,8 miliardi di parametri per il recupero multimodale e multilingue che supporta sia output di 向量模型 (Embeddings) a vettore singolo che a vettore multiplo.
maggio 25, 2025 • 8 minuti letti
Punteggio equo per documenti multimodali con jina-reranker-m0
Similarità del testo: 0.7. Similarità dell'immagine: 0.5. Quale documento è più rilevante? Letteralmente, non si riesce a capirlo—e questo è il problema principale che sta mandando in tilt la ricerca multimodale. Lo risolviamo con il riordinamento unificato (unified reranking).