Panoramica
jina-reranker-m0 è un reranker multimodale multilingue da 2,4B parametri basato su un'architettura di modello vision-language. È il primo reranker a gestire documenti visivi (testo, figure, tabelle, grafici) in più lingue, raggiungendo performance state-of-the-art su ViDoRe (91,02 NDCG-5) e sul retrieval di documenti lunghi multilingue (MLDR). Il modello supporta il reranking text-to-text, text-to-image, image-to-text e a modalità mista.
Metodi
Il modello è costruito su un'architettura VLM decoder-only (2,4B parametri) che combina un vision encoder DFN CLIP ViT con un decoder di linguaggio Qwen2. A differenza dei cross-encoder tradizionali che elaborano solo testo, il backbone VLM gestisce nativamente sia input di testo che di immagine, abilitando il reranking di documenti che contengono contenuto visivo (PDF scansionati, infografiche, presentazioni, tabelle con figure incorporate). La finestra di contesto di 10K token accoglie fino a 768 token per immagine (elaborati come patch 768×28×28). L'addestramento usa un obiettivo contrastivo multimodale su diversi tipi di documento in più lingue. L'architettura decoder-only abilita il reranking listwise e apre possibilità di deduplicazione dei documenti e spiegabilità dei punteggi di ranking tramite meccanismi di attenzione — capacità non disponibili con architetture encoder-only.
Prestazione
Nel reranking text-to-text, il modello ottiene 58,95 NDCG-10 su BEIR, superando jina-embeddings-v3 (55,81) e bge-reranker-v2-m3 (56,51). Per il contenuto multilingue, raggiunge 66,75 NDCG-10 su MIRACL (18 lingue). Sul benchmark MLDR per documenti lunghi, ottiene 59,83 NDCG-10 su 13 lingue. Il retrieval di codice raggiunge 63,55 NDCG-10 su CoIR. Il modello brilla nel retrieval di documenti visivi: 91,02 NDCG-5 su ViDoRe e 43,92 di media su Winoground (ragionamento composizionistico visiolinguistico). Alcune combinazioni di modalità (ad es. image-to-image) sono supportate in modalità zero-shot senza dati di addestramento specifici.
Orientamento
Il modello è accessibile tramite l'API Jina, i marketplace AWS, Azure e GCP, o localmente tramite Hugging Face. Quando si usa l'API, passare stringhe di testo, immagini base64 o URL di immagini — gli utenti nuovi ricevono 10M token gratuiti. Il modello supporta fino a 10K token di input con fino a 768 token per immagine. Per risultati ottimali, il modello ha le performance migliori sui task text-to-text, text-to-image, image-to-text e text-to-modalità mista; image-to-image è zero-shot. L'architettura decoder-only abilita capacità oltre il semplice reranking: reranking a modalità mista, reranking listwise, deduplicazione dei documenti e spiegabilità del ranking basata su attenzione. Usa questo modello quando i tuoi documenti contengono contenuto visivo (PDF scansionati, grafici, infografiche) che i reranker solo testo non possono gestire. Per il reranking di testo puro a costo inferiore, usa jina-reranker-v3.5.








