Immagina di star creando un sistema di ricerca di notizie sportive. Un utente cerca "tennisti che festeggiano la vittoria del campionato" e tu devi trovare gli articoli più rilevanti dal tuo database. Ogni articolo contiene sia una didascalia testuale che un'immagine, tipico della moderna copertura sportiva.
Il tuo sistema deve prendere una query testuale e restituire un elenco classificato dei documenti multimodali più rilevanti dal tuo corpus. Sembra semplice, ma c'è un problema fondamentale che manda a monte tutti gli approcci ovvi.
Ecco cosa succede quando provi a classificare questi documenti. Il tuo modello di 向量模型 (Embedding), ad esempio jina-clip-v2, produce punteggi di similarità come questo:
| Articolo | Tipo di contenuto | Descrizione | Punteggio di similarità |
|---|---|---|---|
| A | Testo | Novak Djokovic vince la finale degli Australian Open in tre set | 0.72 |
| A | Immagine | [foto di un giocatore che tiene in mano il trofeo e sorride] | 0.31 |
| B | Testo | I ritardi meteorologici influiscono sulla programmazione dei tornei all'aperto | 0.23 |
| B | Immagine | [foto di tennisti che saltano e festeggiano] | 0.54 |
Quale articolo è più rilevante? L'articolo A ha un punteggio di testo alto ma un punteggio di immagine basso. L'articolo B ha un punteggio di testo basso ma un punteggio di immagine più alto. La sfida fondamentale è che non puoi confrontare 0.72 (testo) con 0.54 (immagine) perché questi punteggi di similarità esistono su scale completamente diverse.
tagQuando le soluzioni banali falliscono

A causa del divario di modalità in jina-clip-v2 o in quasi tutti gli altri modelli simili a CLIP, qualsiasi approccio ovvio che potresti provare non funziona. Se usi solo il punteggio più alto, ti imbatti nel fatto che i punteggi di testo si raggruppano intorno a 0.2-0.8 mentre i punteggi di immagine si raggruppano intorno a 0.4-0.6. Ciò significa che una corrispondenza di testo mediocre (0.6) batterà sempre un'eccellente corrispondenza di immagine (0.5).
Nemmeno fare la media dei punteggi aiuta. Calcolare (0.7 + 0.3)/2 = 0.5 ti dà un numero, ma cosa significa effettivamente? Stai facendo la media di quantità fondamentalmente prive di significato. Allo stesso modo, qualsiasi schema di ponderazione fisso è arbitrario: a volte il testo conta di più, a volte le immagini, e questo dipende interamente dalla query e dal documento specifici.
Anche normalizzare prima i punteggi non risolve il problema principale. Stai ancora cercando di combinare misure di similarità fondamentalmente diverse che catturano diversi aspetti della rilevanza.
tagCosa succede realmente

Per avere un'idea migliore di ciò con cui stiamo lavorando, ecco un esempio di documento dal dataset EDIS, che mostra l'immagine (una partita di calcio tedesca) e la didascalia (One More Field Where the Content Trails Germany).

Nel complesso, jina-clip-v2 mostra similarità molto più elevate quando si confronta query-testo rispetto a query-immagine nel dataset EDIS, in parte a causa del modo in cui il modello è stato addestrato e in parte a causa del dataset stesso:

Pertanto, sembra logico recuperare un documento in base al suo testo piuttosto che alla sua immagine. E, come possiamo vedere nel grafico qui sotto, otteniamo risultati molto migliori confrontando la query di testo ... for undocumented immigrants helping to establish legal status in the United States con il contenuto testuale del corpus. Infatti, la ricerca per immagine non riesce affatto a recuperare il documento ground truth (evidenziato in giallo):

top_k di 3.Ma non fatevi ingannare. Nonostante la query-testo mostri punteggi di similarità più alti, i punteggi di similarità query-testo e query-immagine non sono comparabili. Possiamo vederlo guardando recall@10 quando usiamo jina-clip-v2 per recuperare 32 documenti dal dataset EDIS. Chiaramente, il recall è più alto con query-immagine:
| Recall@10 | |
|---|---|
| Query-to-text | 14.55 |
| Query-to-image | 22.38 |
Possiamo vederlo qui sotto: se usiamo una query dal dataset, Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi., possiamo recuperare il documento ground truth solo tramite il suo contenuto di immagine. La ricerca tramite il suo contenuto testuale non restituisce alcuna corrispondenza:

top_k di 3.Quindi, se i punteggi di similarità implicano che dovremmo recuperare i documenti dal loro testo e il richiamo implica che dovremmo recuperarli dalle loro immagini, cosa dovremmo scegliere? Certamente, le Figure 3 e 4 non suggeriscono un vincitore assoluto. Quale modalità presenta realmente la corrispondenza più stretta tra la nostra query e il documento che stiamo cercando? E se volessimo unire i candidati dal recupero query-to-text e query-to-image, come possiamo selezionare in modo significativo le migliori corrispondenze se non possiamo nemmeno confrontare i punteggi? Chiaramente, usare solo jina-clip-v2 non sarà sufficiente. Dobbiamo aggiungere un altro modello al mix.
tagUna Semplice Pipeline a Due Stadi
Ad aprile 2025 abbiamo rilasciato jina-reranker-m0, un重排器 (Reranker) multilingue multimodale per il recupero di documenti visivi. Possiamo vedere il suo divario di modalità più stretto di seguito, dove jina-reranker-m0 mostra punteggi di similarità query-to-text e query-to-image comparabili, in contrasto con il divario molto più ampio mostrato da jina-clip-v2:

Con questo in mente, possiamo usare jina-reranker-m0 per un secondo passaggio nella catena di recupero, dopo che i risultati iniziali sono stati recuperati da jina-clip-v2:
Fase 1: Recupera i candidati da entrambe le modalità
- Usa jina-clip-v2 per ottenere 16 documenti tramite ricerca di testo + 16 tramite ricerca di immagini
- Accetta che non possiamo ancora confrontare i punteggi
Fase 2: Riordinamento unificato
- Invia ogni coppia (query + documento completo) a jina-reranker-m0
- Il 重排器 (Reranker) elabora sia il testo CHE l'immagine insieme
- Output: singolo punteggio di rilevanza su una scala unificata

Abbiamo ampliato gli esperimenti dalla Tabella 1, ora usando jina-clip-v2 per recuperare documenti dal corpus, quindi jina-reranker-m0 per riordinarli:
- Recupera 32 documenti tramite query-to-text, quindi riordina in base al punteggio query-to-text.
- Recupera 32 documenti tramite query-to-image, quindi riordina in base al punteggio query-to-image.
- Recupera 16 documenti tramite query-to-text e 16 tramite query-to-image. Riordina in base al punteggio query-to-text o query-to-image, a seconda della modalità di query.
- Recupera 16 documenti tramite query-to-text e 16 tramite query-to-image. Riordina in base ai punteggi medi query-to-text e query-to-image di ciascun documento, dando un punteggio finale di (query-to-text + query-to-image)/2.
| Experiment | Description | Recall@10 - with jina-clip-v2 | Recall@10 - with jina-reranker-m0 |
|---|---|---|---|
| 1 | 32 docs: query-to-text | 14.55 | 17.42 |
| 2 | 32 docs: query-to-image | 22.38 | 28.94 |
| 3 | 16 docs: query-to-text 16 docs: query-to-image |
14.55 | 33.81 |
| 4 | 16 docs: query-to-text 16 docs: query-to-image Combined average reranker scores |
14.55 | 36.24 |
Come possiamo vedere, eseguendo un secondo passaggio con jina-reranker-m0, il richiamo aumenta su tutta la linea, indipendentemente dalla modalità. Tuttavia, vediamo il maggiore aumento quando combiniamo sia il contenuto testuale che quello delle immagini dai documenti recuperati, raggiungendo un recall@10 di 36.24. Un esempio visivo mostra che jina-reranker-m0 classifica costantemente il documento ground truth al primo posto, sia che si cerchi contenuto testuale che di immagini:

top_k di 1 risultato per ogni metodologia di riordinamento (quattro colonne a destra), che mostra che la combinazione di punteggi di similarità di immagini e testo classifica costantemente il documento ground truth al primo posto.top_k di 3 per i diversi metodi di recupero, per motivi di spazio la Figura 7 mostra solo top_k di 1 per ogni query.tagConclusioni
Questo semplice approccio a due stadi offre un miglioramento del 62% nel richiamo perché il sistema finalmente sfrutta ciò che gli umani fanno naturalmente: considerare sia ciò che leggiamo che ciò che vediamo per determinare la rilevanza. La lezione si estende oltre la ricerca: quando si ha a che fare con sistemi di intelligenza artificiale multimodale, gli approcci a passaggio singolo che trattano le modalità separatamente colpiranno sempre questo muro di incompatibilità di punteggio. Le architetture a due stadi che recuperano ampiamente e poi classificano in modo intelligente stanno diventando essenziali. Prova jina-reranker-m0 tramite la nostra API o su AWS, GCP e Azure.








