Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Quando le soluzioni banali falliscono
Cosa succede realmente
Una Semplice Pipeline a Due Stadi
Conclusioni
Blog tecnico
maggio 25, 2025

Punteggio equo per documenti multimodali con jina-reranker-m0

Similarità del testo: 0.7. Similarità dell'immagine: 0.5. Quale documento è più rilevante? Letteralmente, non si riesce a capirlo—e questo è il problema principale che sta mandando in tilt la ricerca multimodale. Lo risolviamo con il riordinamento unificato (unified reranking).
Nan Wang, Alex C-G • 8 minuti letti

Immagina di star creando un sistema di ricerca di notizie sportive. Un utente cerca "tennisti che festeggiano la vittoria del campionato" e tu devi trovare gli articoli più rilevanti dal tuo database. Ogni articolo contiene sia una didascalia testuale che un'immagine, tipico della moderna copertura sportiva.

Il tuo sistema deve prendere una query testuale e restituire un elenco classificato dei documenti multimodali più rilevanti dal tuo corpus. Sembra semplice, ma c'è un problema fondamentale che manda a monte tutti gli approcci ovvi.

Ecco cosa succede quando provi a classificare questi documenti. Il tuo modello di 向量模型 (Embedding), ad esempio jina-clip-v2, produce punteggi di similarità come questo:

Articolo Tipo di contenuto Descrizione Punteggio di similarità
A Testo Novak Djokovic vince la finale degli Australian Open in tre set 0.72
A Immagine [foto di un giocatore che tiene in mano il trofeo e sorride] 0.31
B Testo I ritardi meteorologici influiscono sulla programmazione dei tornei all'aperto 0.23
B Immagine [foto di tennisti che saltano e festeggiano] 0.54

Quale articolo è più rilevante? L'articolo A ha un punteggio di testo alto ma un punteggio di immagine basso. L'articolo B ha un punteggio di testo basso ma un punteggio di immagine più alto. La sfida fondamentale è che non puoi confrontare 0.72 (testo) con 0.54 (immagine) perché questi punteggi di similarità esistono su scale completamente diverse.

tagQuando le soluzioni banali falliscono

The What and Why of Text-Image Modality Gap in CLIP Models
You can’t just use a CLIP model to retrieve text and images and sort the results by score. Why? Because of the modality gap. What is it, and where does it come from?
Jina AIBo Wang, Scott Martens

A causa del divario di modalità in jina-clip-v2 o in quasi tutti gli altri modelli simili a CLIP, qualsiasi approccio ovvio che potresti provare non funziona. Se usi solo il punteggio più alto, ti imbatti nel fatto che i punteggi di testo si raggruppano intorno a 0.2-0.8 mentre i punteggi di immagine si raggruppano intorno a 0.4-0.6. Ciò significa che una corrispondenza di testo mediocre (0.6) batterà sempre un'eccellente corrispondenza di immagine (0.5).

Nemmeno fare la media dei punteggi aiuta. Calcolare (0.7 + 0.3)/2 = 0.5 ti dà un numero, ma cosa significa effettivamente? Stai facendo la media di quantità fondamentalmente prive di significato. Allo stesso modo, qualsiasi schema di ponderazione fisso è arbitrario: a volte il testo conta di più, a volte le immagini, e questo dipende interamente dalla query e dal documento specifici.

Anche normalizzare prima i punteggi non risolve il problema principale. Stai ancora cercando di combinare misure di similarità fondamentalmente diverse che catturano diversi aspetti della rilevanza.

tagCosa succede realmente

EDIS: Entity-Driven Image Search over Multimodal Web Content
Making image retrieval methods practical for real-world search applications requires significant progress in dataset scales, entity comprehension, and multimodal information fusion. In this work, we introduce \textbf{E}ntity-\textbf{D}riven \textbf{I}mage \textbf{S}earch (EDIS), a challenging dataset for cross-modal image search in the news domain. EDIS consists of 1 million web images from actual search engine results and curated datasets, with each image paired with a textual description. Unlike datasets that assume a small set of single-modality candidates, EDIS reflects real-world web image search scenarios by including a million multimodal image-text pairs as candidates. EDIS encourages the development of retrieval models that simultaneously address cross-modal information fusion and matching. To achieve accurate ranking results, a model must: 1) understand named entities and events from text queries, 2) ground entities onto images or text descriptions, and 3) effectively fuse textual and visual representations. Our experimental results show that EDIS challenges state-of-the-art methods with dense entities and a large-scale candidate set. The ablation study also proves that fusing textual features with visual features is critical in improving retrieval results.
arXiv.orgSiqi Liu

Per avere un'idea migliore di ciò con cui stiamo lavorando, ecco un esempio di documento dal dataset EDIS, che mostra l'immagine (una partita di calcio tedesca) e la didascalia (One More Field Where the Content Trails Germany).

Figure 1: Esempio di documento multimodale contenente sia contenuto di immagine che di testo. Poiché abbiamo due modalità, per qualsiasi query data ora ci sono due divari semantici (tra la query e il testo, e la query e l'immagine). Per ottenere i migliori risultati, dovremmo cercare il contenuto testuale dei documenti o il contenuto dell'immagine?

Nel complesso, jina-clip-v2 mostra similarità molto più elevate quando si confronta query-testo rispetto a query-immagine nel dataset EDIS, in parte a causa del modo in cui il modello è stato addestrato e in parte a causa del dataset stesso:

Figure 2: Punteggi di similarità tra query-immagine (in rosso) e query-testo (in blu) utilizzando jina-clip-v2.

Pertanto, sembra logico recuperare un documento in base al suo testo piuttosto che alla sua immagine. E, come possiamo vedere nel grafico qui sotto, otteniamo risultati molto migliori confrontando la query di testo ... for undocumented immigrants helping to establish legal status in the United States con il contenuto testuale del corpus. Infatti, la ricerca per immagine non riesce affatto a recuperare il documento ground truth (evidenziato in giallo):

Figure 3: Esempio in cui il documento ground-truth (evidenziato con bordo giallo) può essere recuperato solo tramite il recupero query-testo di jina-clip-v2 quando si utilizza top_k di 3.

Ma non fatevi ingannare. Nonostante la query-testo mostri punteggi di similarità più alti, i punteggi di similarità query-testo e query-immagine non sono comparabili. Possiamo vederlo guardando recall@10 quando usiamo jina-clip-v2 per recuperare 32 documenti dal dataset EDIS. Chiaramente, il recall è più alto con query-immagine:

Recall@10
Query-to-text 14.55
Query-to-image 22.38

Possiamo vederlo qui sotto: se usiamo una query dal dataset, Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi., possiamo recuperare il documento ground truth solo tramite il suo contenuto di immagine. La ricerca tramite il suo contenuto testuale non restituisce alcuna corrispondenza:

Figure 4: Esempio in cui il documento ground-truth (evidenziato con bordo giallo) può essere recuperato solo tramite il recupero query-immagine di jina-clip-v2 quando si utilizza top_k di 3.

Quindi, se i punteggi di similarità implicano che dovremmo recuperare i documenti dal loro testo e il richiamo implica che dovremmo recuperarli dalle loro immagini, cosa dovremmo scegliere? Certamente, le Figure 3 e 4 non suggeriscono un vincitore assoluto. Quale modalità presenta realmente la corrispondenza più stretta tra la nostra query e il documento che stiamo cercando? E se volessimo unire i candidati dal recupero query-to-text e query-to-image, come possiamo selezionare in modo significativo le migliori corrispondenze se non possiamo nemmeno confrontare i punteggi? Chiaramente, usare solo jina-clip-v2 non sarà sufficiente. Dobbiamo aggiungere un altro modello al mix.

tagUna Semplice Pipeline a Due Stadi

Ad aprile 2025 abbiamo rilasciato jina-reranker-m0, un重排器 (Reranker) multilingue multimodale per il recupero di documenti visivi. Possiamo vedere il suo divario di modalità più stretto di seguito, dove jina-reranker-m0 mostra punteggi di similarità query-to-text e query-to-image comparabili, in contrasto con il divario molto più ampio mostrato da jina-clip-v2:

Figura 6: Rispetto a jina-clip-v2, jina-reranker-m0 mostra molta meno differenza tra i punteggi di similarità query-to-image (rosso) e query-to-text (blu).

Con questo in mente, possiamo usare jina-reranker-m0 per un secondo passaggio nella catena di recupero, dopo che i risultati iniziali sono stati recuperati da jina-clip-v2:

Fase 1: Recupera i candidati da entrambe le modalità

  • Usa jina-clip-v2 per ottenere 16 documenti tramite ricerca di testo + 16 tramite ricerca di immagini
  • Accetta che non possiamo ancora confrontare i punteggi

Fase 2: Riordinamento unificato

  • Invia ogni coppia (query + documento completo) a jina-reranker-m0
  • Il 重排器 (Reranker) elabora sia il testo CHE l'immagine insieme
  • Output: singolo punteggio di rilevanza su una scala unificata
Figura 5: Indicizzazione di documenti multimodali e un processo di recupero multimodale a due stadi con jina-clip-v2 e jina-reranker-m0.

Abbiamo ampliato gli esperimenti dalla Tabella 1, ora usando jina-clip-v2 per recuperare documenti dal corpus, quindi jina-reranker-m0 per riordinarli:

  1. Recupera 32 documenti tramite query-to-text, quindi riordina in base al punteggio query-to-text.
  2. Recupera 32 documenti tramite query-to-image, quindi riordina in base al punteggio query-to-image.
  3. Recupera 16 documenti tramite query-to-text e 16 tramite query-to-image. Riordina in base al punteggio query-to-text o query-to-image, a seconda della modalità di query.
  4. Recupera 16 documenti tramite query-to-text e 16 tramite query-to-image. Riordina in base ai punteggi medi query-to-text e query-to-image di ciascun documento, dando un punteggio finale di (query-to-text + query-to-image)/2.
💡
Si noti che stiamo misurando le prestazioni zero-shot su EDIS. Non abbiamo messo a punto né jina-clip-v2 né jina-reranker-m0 usando il set di dati.
Experiment Description Recall@10 - with jina-clip-v2 Recall@10 - with jina-reranker-m0
1 32 docs: query-to-text 14.55 17.42
2 32 docs: query-to-image 22.38 28.94
3 16 docs: query-to-text
16 docs: query-to-image
14.55 33.81
4 16 docs: query-to-text
16 docs: query-to-image
Combined average reranker scores
14.55 36.24
💡
Gli esperimenti 1, 3 e 4 mostrano tutti lo stesso risultato per recall@10 con jina-clip-v2 a causa dei punteggi query-to-text più alti dei punteggi query-to-image. Pertanto, i primi dieci risultati sono dominati dai documenti recuperati tramite testo.

Come possiamo vedere, eseguendo un secondo passaggio con jina-reranker-m0, il richiamo aumenta su tutta la linea, indipendentemente dalla modalità. Tuttavia, vediamo il maggiore aumento quando combiniamo sia il contenuto testuale che quello delle immagini dai documenti recuperati, raggiungendo un recall@10 di 36.24. Un esempio visivo mostra che jina-reranker-m0 classifica costantemente il documento ground truth al primo posto, sia che si cerchi contenuto testuale che di immagini:

Figura 7: Query di esempio (sulla sinistra) e top_k di 1 risultato per ogni metodologia di riordinamento (quattro colonne a destra), che mostra che la combinazione di punteggi di similarità di immagini e testo classifica costantemente il documento ground truth al primo posto.
💡
Mentre le Figure 3 e 4 mostrano un top_k di 3 per i diversi metodi di recupero, per motivi di spazio la Figura 7 mostra solo top_k di 1 per ogni query.

tagConclusioni

Questo semplice approccio a due stadi offre un miglioramento del 62% nel richiamo perché il sistema finalmente sfrutta ciò che gli umani fanno naturalmente: considerare sia ciò che leggiamo che ciò che vediamo per determinare la rilevanza. La lezione si estende oltre la ricerca: quando si ha a che fare con sistemi di intelligenza artificiale multimodale, gli approcci a passaggio singolo che trattano le modalità separatamente colpiranno sempre questo muro di incompatibilità di punteggio. Le architetture a due stadi che recuperano ampiamente e poi classificano in modo intelligente stanno diventando essenziali. Prova jina-reranker-m0 tramite la nostra API o su AWS, GCP e Azure.

Categorie:
Blog tecnico
rss_feed

Per saperne di più
marzo 11, 2026 • 7 minuti letti
Bootstrapping Audio Embeddings from Multimodal LLMs
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
marzo 06, 2026 • 6 minuti letti
Identifying Embedding Models from Raw Numerical Values
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
settembre 09, 2025 • 11 minuti letti
Multimodal Embeddings in Llama.cpp and GGUF
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.