Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Reader
Converti qualsiasi URL in Markdown per un migliore ancoraggio dei LLM.
Embeddings
Embeddings multimodali e multilingue.
Reranker
Reranker per massimizzare la pertinenza dei risultati di ricerca.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Reranker
copyright CC BY-NC 4.0
open_in_new Post di rilascio

jina-reranker-m0

Modello di reranking multimodale multilingue per la classificazione di documenti visivi
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2025-04-08
Ingresso
abc
Testo (query)
image
Immagine (Query)
abc
Testo (Documento)
image
Immagine (Documento)
arrow_forward
Produzione
format_list_numbered
Classifiche
Dettagli del modello
Parametri: 2.4B
Lunghezza del token di input: 10K
Dimensione immagine di input: 768×28×28
Modello base help_outline
open_in_new
Qwen2-VL-2B
open_in_new
DFN CLIP ViT
Lingue addestrate help_outline
24 lingue
Lingue supportate help_outline
29 lingue
Quantizzazioni help_outline
GGUF
Modelli correlati
link
jina-reranker-v2-base-multilingual
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Grafico I/O 1

multiplo

Testo

Testo

jina-reranker-m0

Classifica

Grafico I/O 2

multiplo

Immagine

Testo

jina-reranker-m0

Classifica

Grafico I/O 3

multiplo

Testo

Immagine

jina-reranker-m0

Classifica

Grafico I/O 4

multiplo

Immagine

Immagine

jina-reranker-m0

Classifica

Frontiera di Pareto help_outline
workspace_premium
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parametri (log)nDCG@5
Questo modello
Sulla frontiera
Jina AI
Altri
ViDoRe v1
91.02
Parametri
2.4B
Classifica per punteggio
7 / 24
Frontiera di Pareto
Dietro
Distribuzione dei valorihelp_outline
AUC 0.9383
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
0.7120.200.400.600.801.00
Correlate83.2%
Negativo difficile24.7%
Non correlate9.3%
Soglie consigliate
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
bilanciata · 0.692
AUC
0.9383
Soglia del rumore
0.965
Crollo del richiamo
0.425
Coppie misurate
119 / 2,856
Punteggio per posizionehelp_outline
12345678910
Punteggio medio a ogni posizione
Chi vince la prima posizionehelp_outline
Una corrispondenza corretta vince il 66% di 119 query
Scegli i modelli da confrontare

Panoramica

jina-reranker-m0 è un reranker multimodale multilingue da 2,4B parametri basato su un'architettura di modello vision-language. È il primo reranker a gestire documenti visivi (testo, figure, tabelle, grafici) in più lingue, raggiungendo performance state-of-the-art su ViDoRe (91,02 NDCG-5) e sul retrieval di documenti lunghi multilingue (MLDR). Il modello supporta il reranking text-to-text, text-to-image, image-to-text e a modalità mista.

Metodi

Il modello è costruito su un'architettura VLM decoder-only (2,4B parametri) che combina un vision encoder DFN CLIP ViT con un decoder di linguaggio Qwen2. A differenza dei cross-encoder tradizionali che elaborano solo testo, il backbone VLM gestisce nativamente sia input di testo che di immagine, abilitando il reranking di documenti che contengono contenuto visivo (PDF scansionati, infografiche, presentazioni, tabelle con figure incorporate). La finestra di contesto di 10K token accoglie fino a 768 token per immagine (elaborati come patch 768×28×28). L'addestramento usa un obiettivo contrastivo multimodale su diversi tipi di documento in più lingue. L'architettura decoder-only abilita il reranking listwise e apre possibilità di deduplicazione dei documenti e spiegabilità dei punteggi di ranking tramite meccanismi di attenzione — capacità non disponibili con architetture encoder-only.

Prestazione

Nel reranking text-to-text, il modello ottiene 58,95 NDCG-10 su BEIR, superando jina-embeddings-v3 (55,81) e bge-reranker-v2-m3 (56,51). Per il contenuto multilingue, raggiunge 66,75 NDCG-10 su MIRACL (18 lingue). Sul benchmark MLDR per documenti lunghi, ottiene 59,83 NDCG-10 su 13 lingue. Il retrieval di codice raggiunge 63,55 NDCG-10 su CoIR. Il modello brilla nel retrieval di documenti visivi: 91,02 NDCG-5 su ViDoRe e 43,92 di media su Winoground (ragionamento composizionistico visiolinguistico). Alcune combinazioni di modalità (ad es. image-to-image) sono supportate in modalità zero-shot senza dati di addestramento specifici.

Orientamento

Il modello è accessibile tramite l'API Jina, i marketplace AWS, Azure e GCP, o localmente tramite Hugging Face. Quando si usa l'API, passare stringhe di testo, immagini base64 o URL di immagini — gli utenti nuovi ricevono 10M token gratuiti. Il modello supporta fino a 10K token di input con fino a 768 token per immagine. Per risultati ottimali, il modello ha le performance migliori sui task text-to-text, text-to-image, image-to-text e text-to-modalità mista; image-to-image è zero-shot. L'architettura decoder-only abilita capacità oltre il semplice reranking: reranking a modalità mista, reranking listwise, deduplicazione dei documenti e spiegabilità del ranking basata su attenzione. Usa questo modello quando i tuoi documenti contengono contenuto visivo (PDF scansionati, grafici, infografiche) che i reranker solo testo non possono gestire. Per il reranking di testo puro a costo inferiore, usa jina-reranker-v3.5.

Blog che menzionano questo modello
ottobre 03, 2025 • 7 minuti letti
Jina Reranker v3: Reranker Listwise da 0.6B per il recupero multilingue SOTA
Nuovo *reranker* *listwise* da 0.6 miliardi di parametri che considera la query e tutti i documenti candidati in una singola finestra di contesto.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
agosto 13, 2025 • 15 minuti letti
Ottimizzazione dei GGUF per i modelli di Embeddings solo decoder
Ottenere 4000 token/sec per un modello di 向量模型 da 3 miliardi di parametri su GPU L4 è probabilmente il massimo che si possa ottenere con llama.cpp. O forse no?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
luglio 14, 2025 • 11 minuti letti
Ottimizzazione submodulare per la selezione di testo, il Reranking di passaggi e l'ingegneria del contesto
Mentre altri si affidano all'ottimizzazione dei Prompt e sperano per il meglio, dovresti imparare l'ottimizzazione submodulare che fornisce un framework basato su principi con garanzie teoriche per una migliore ingegneria del contesto.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: 向量模型 (Embeddings) universali per il recupero multimodale multilingue
Jina Embeddings v4 è un modello di 向量模型 (Embeddings) universale da 3,8 miliardi di parametri per il recupero multimodale e multilingue che supporta sia output di 向量模型 (Embeddings) a vettore singolo che a vettore multiplo.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
maggio 25, 2025 • 8 minuti letti
Punteggio equo per documenti multimodali con jina-reranker-m0
Similarità del testo: 0.7. Similarità dell'immagine: 0.5. Quale documento è più rilevante? Letteralmente, non si riesce a capirlo—e questo è il problema principale che sta mandando in tilt la ricerca multimodale. Lo risolviamo con il riordinamento unificato (unified reranking).
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Lingua / tema attuale
Search Foundation
Reader
Embeddings
Reranker
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizie
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.