Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Riclassificazione
copyright CC BY-NC 4.0
open_in_new Pubblicazione post

jina-reranker-m0

Modello di riclassificazione multimodale multilingue per la classificazione di documenti visivi
Licenza
copyright CC-BY-NC-4.0
Data di rilascio
calendar_month
2025-04-08
Ingresso
abc
Testo (richiesta)
image
Immagine (Query)
abc
Testo (Documento)
image
Immagine (Documento)
arrow_forward
Produzione
format_list_numbered
Classifiche
Dettagli del modello
Parametri: 2.4B
Lunghezza del token di input: 10K
Dimensione immagine di input: 768×28×28
Modello base help_outline
open_in_new
Qwen2-VL-2B
Lingue addestrate help_outline
24 lingue
Lingue supportate help_outline
29 lingue
Quantizzazioni help_outline
GGUF
Modelli correlati
link
jina-reranker-v2-base-multilingual
Disponibile tramite
API di Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Grafico I/O 1

multiplo

Testo

Testo

jina-reranker-m0

Classifica

Grafico I/O 2

multiplo

Immagine

Testo

jina-reranker-m0

Classifica

Grafico I/O 3

multiplo

Testo

Immagine

jina-reranker-m0

Classifica

Grafico I/O 4

multiplo

Immagine

Immagine

jina-reranker-m0

Classifica

Pareto fronthelp_outline
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameters (log)nDCG@5
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Distribuzione dei valorihelp_outline
AUC 0.9383
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Immagine / banner
Immagine / logo
0.7120.200.400.600.801.00
Correlate83.2%
Negativo difficile24.7%
Non correlate9.3%
Soglie consigliate
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
bilanciata · 0.692
AUC
0.9383
Soglia del rumore
0.965
Crollo del richiamo
0.425
Coppie misurate
119 / 2,856
Punteggio per posizionehelp_outline
12345678910
Punteggio medio a ogni posizione
Chi vince la prima posizionehelp_outline
Una corrispondenza corretta vince il 66% di 119 query
Scegli i modelli da confrontare

Panoramica

jina-reranker-m0 è un rivoluzionario modello di reranker multimodale e multilingue progettato per classificare i documenti visivi in più lingue. Ciò che rende questo modello eccezionale è la sua capacità di elaborare query insieme a immagini di documenti visivamente ricche, tra cui pagine con testo, figure, tabelle e vari layout, in 29 lingue. Il modello produce un elenco classificato di documenti ordinati in base alla loro pertinenza alla query di input. A differenza dei precedenti reranker che hanno lottato con il problema del "gap di modalità" (in cui le immagini si raggruppavano vicino ad altre immagini mentre il testo si raggruppava vicino al testo), jina-reranker-m0 unifica le modalità testuali e visive in un singolo modello solo decoder, creando un'esperienza di ricerca multimodale senza soluzione di continuità in grado di classificare efficacemente sia le immagini che i documenti di testo insieme.

Metodi

L'architettura di jina-reranker-m0 rappresenta un significativo cambiamento rispetto agli approcci precedenti. Basato su Qwen2-VL-2B con 2,4 miliardi di parametri, passa da una classica architettura cross-encoder a un modello di linguaggio visivo basato solo sul decoder. Il sistema sfrutta l'encoder e il proiettore visivi pre-addestrati di Qwen2-VL, perfeziona il suo ampio modello linguistico con LoRA (Low-Rank Adaptation) e impiega un MLP post-addestrato per generare logit di ranking che misurano la pertinenza query-documento. Questo modello discriminativo può gestire fino a 32.000 token e supporta immagini da 56×56 pixel fino a una risoluzione di 4K. Durante l'elaborazione delle immagini, il Vision Transformer (ViT) e il proiettore condensano i token 2×2 adiacenti in singoli token visivi, mentre token speciali delimitano chiaramente i token visivi, consentendo al modello linguistico di integrarsi e ragionare correttamente su elementi sia visivi che testuali.

Prestazione

Jina-reranker-m0 ottiene risultati impressionanti in più benchmark. Nel riclassifica text-to-text, ottiene 58,95 NDCG-10 nel benchmark BEIR, superando concorrenti come jina-embeddings-v3 (55,81) e bge-reranker-v2-m3 (56,51). Per i contenuti multilingue, ottiene 66,75 NDCG-10 nel benchmark MIRACL che copre 18 lingue. Nel benchmark MLDR per documenti lunghi, ottiene 59,83 NDCG-10 in 13 lingue. Per il recupero del codice nel benchmark CoIR, ottiene 63,55 NDCG-10, superando significativamente i concorrenti. Ma il modello eccelle davvero nel recupero visivo dei documenti: nel benchmark ViDoRe ottiene un impressionante punteggio di 91,02 NDCG-5, mentre su Winoground, che testa il ragionamento compositivo visio-linguistico, ottiene un punteggio medio di 43,92, dimostrando la sua capacità superiore di comprendere le relazioni tra testo e immagini rispetto ad altri modelli.

Orientamento

Per massimizzare il potenziale di jina-reranker-m0, gli sviluppatori dovrebbero considerare diverse strategie di implementazione. Il modello è accessibile tramite API, marketplace di servizi cloud (AWS, Azure, GCP) o localmente tramite Hugging Face. Utilizzando l'API, gli sviluppatori possono passare stringhe di testo, immagini base64 o URL di immagini, con i nuovi utenti che possono beneficiare di dieci milioni di token gratuiti. Sebbene il modello offra prestazioni eccezionali su attività di tipo testo-testo, testo-immagine, immagine-testo e testo-misto-unimodale grazie a un addestramento approfondito, è importante notare che alcune combinazioni (come immagine-immagine) sono supportate in modalità zero-shot senza un addestramento specifico. Per risultati ottimali, ricorda che il modello supporta fino a 10.000 token di input con un massimo di 768 token per immagine. L'approccio basato solo sul decoder dell'architettura apre possibilità che vanno oltre la semplice riclassificazione, tra cui la vera riclassificazione in modalità mista, la riclassificazione in base all'elenco, la deduplicazione dei documenti e la spiegabilità del punteggio di classificazione tramite meccanismi di attenzione, funzionalità che non erano realizzabili con le precedenti architetture basate solo sul codificatore.
Blog che menzionano questo modello
ottobre 03, 2025 • 7 minuti letti
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
agosto 13, 2025 • 15 minuti letti
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
luglio 14, 2025 • 11 minuti letti
Submodular Optimization for Text Selection, Passage Reranking & Context Engineering
While others rely on prompt tuning and hope for the best, you should learn submodular optimization that provides a principled framework with theoretical guarantees for better context engineering.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
giugno 25, 2025 • 12 minuti letti
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
maggio 25, 2025 • 8 minuti letti
Fair Scoring for Multimodal Documents with jina-reranker-m0
Text similarity: 0.7. Image similarity: 0.5. Which document is more relevant? You literally cannot tell—and that's the core problem breaking multimodal search. We solve it with unified reranking.
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.