Grafico I/O 1
Grafico I/O 2
Grafico I/O 3
Grafico I/O 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Distribuzione dei valorihelp_outlineAUC 0.9383
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
Correlate83.2%
Negativo difficile24.7%
Non correlate9.3%
Soglie consigliate
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
bilanciata · 0.692
AUC
0.9383
Soglia del rumore
0.965
Crollo del richiamo
0.425
Coppie misurate
119 / 2,856
Punteggio per posizionehelp_outline
Punteggio medio a ogni posizione
Chi vince la prima posizionehelp_outline
Una corrispondenza corretta vince il 66% di 119 query
Scegli i modelli da confrontare
Panoramica
jina-reranker-m0 è un rivoluzionario modello di reranker multimodale e multilingue progettato per classificare i documenti visivi in più lingue. Ciò che rende questo modello eccezionale è la sua capacità di elaborare query insieme a immagini di documenti visivamente ricche, tra cui pagine con testo, figure, tabelle e vari layout, in 29 lingue. Il modello produce un elenco classificato di documenti ordinati in base alla loro pertinenza alla query di input. A differenza dei precedenti reranker che hanno lottato con il problema del "gap di modalità" (in cui le immagini si raggruppavano vicino ad altre immagini mentre il testo si raggruppava vicino al testo), jina-reranker-m0 unifica le modalità testuali e visive in un singolo modello solo decoder, creando un'esperienza di ricerca multimodale senza soluzione di continuità in grado di classificare efficacemente sia le immagini che i documenti di testo insieme.
Metodi
L'architettura di jina-reranker-m0 rappresenta un significativo cambiamento rispetto agli approcci precedenti. Basato su Qwen2-VL-2B con 2,4 miliardi di parametri, passa da una classica architettura cross-encoder a un modello di linguaggio visivo basato solo sul decoder. Il sistema sfrutta l'encoder e il proiettore visivi pre-addestrati di Qwen2-VL, perfeziona il suo ampio modello linguistico con LoRA (Low-Rank Adaptation) e impiega un MLP post-addestrato per generare logit di ranking che misurano la pertinenza query-documento. Questo modello discriminativo può gestire fino a 32.000 token e supporta immagini da 56×56 pixel fino a una risoluzione di 4K. Durante l'elaborazione delle immagini, il Vision Transformer (ViT) e il proiettore condensano i token 2×2 adiacenti in singoli token visivi, mentre token speciali delimitano chiaramente i token visivi, consentendo al modello linguistico di integrarsi e ragionare correttamente su elementi sia visivi che testuali.
Prestazione
Jina-reranker-m0 ottiene risultati impressionanti in più benchmark. Nel riclassifica text-to-text, ottiene 58,95 NDCG-10 nel benchmark BEIR, superando concorrenti come jina-embeddings-v3 (55,81) e bge-reranker-v2-m3 (56,51). Per i contenuti multilingue, ottiene 66,75 NDCG-10 nel benchmark MIRACL che copre 18 lingue. Nel benchmark MLDR per documenti lunghi, ottiene 59,83 NDCG-10 in 13 lingue. Per il recupero del codice nel benchmark CoIR, ottiene 63,55 NDCG-10, superando significativamente i concorrenti. Ma il modello eccelle davvero nel recupero visivo dei documenti: nel benchmark ViDoRe ottiene un impressionante punteggio di 91,02 NDCG-5, mentre su Winoground, che testa il ragionamento compositivo visio-linguistico, ottiene un punteggio medio di 43,92, dimostrando la sua capacità superiore di comprendere le relazioni tra testo e immagini rispetto ad altri modelli.
Orientamento
Per massimizzare il potenziale di jina-reranker-m0, gli sviluppatori dovrebbero considerare diverse strategie di implementazione. Il modello è accessibile tramite API, marketplace di servizi cloud (AWS, Azure, GCP) o localmente tramite Hugging Face. Utilizzando l'API, gli sviluppatori possono passare stringhe di testo, immagini base64 o URL di immagini, con i nuovi utenti che possono beneficiare di dieci milioni di token gratuiti. Sebbene il modello offra prestazioni eccezionali su attività di tipo testo-testo, testo-immagine, immagine-testo e testo-misto-unimodale grazie a un addestramento approfondito, è importante notare che alcune combinazioni (come immagine-immagine) sono supportate in modalità zero-shot senza un addestramento specifico. Per risultati ottimali, ricorda che il modello supporta fino a 10.000 token di input con un massimo di 768 token per immagine. L'approccio basato solo sul decoder dell'architettura apre possibilità che vanno oltre la semplice riclassificazione, tra cui la vera riclassificazione in modalità mista, la riclassificazione in base all'elenco, la deduplicazione dei documenti e la spiegabilità del punteggio di classificazione tramite meccanismi di attenzione, funzionalità che non erano realizzabili con le precedenti architetture basate solo sul codificatore.
Blog che menzionano questo modello








