Stellen Sie sich vor, Sie entwickeln ein Suchsystem für Sportnachrichten. Ein Benutzer sucht nach "Tennispieler feiern Meisterschaftssieg", und Sie müssen die relevantesten Artikel aus Ihrer Datenbank finden. Jeder Artikel enthält sowohl eine Textunterschrift als auch ein Bild - typisch für moderne Sportberichterstattung.
Ihr System muss eine Textabfrage entgegennehmen und eine Rangliste der relevantesten multimodalen Dokumente aus Ihrem Korpus zurückgeben. Klingt unkompliziert, aber es gibt ein grundlegendes Problem, das alle offensichtlichen Ansätze zunichte macht.
Folgendes passiert, wenn Sie versuchen, diese Dokumente zu bewerten. Ihr 向量模型 (Embedding)-Modell, sagen wir jina-clip-v2, erzeugt Ähnlichkeitswerte wie diese:
| Artikel | Inhaltstyp | Beschreibung | Ähnlichkeitswert |
|---|---|---|---|
| A | Text | Novak Djokovic gewinnt Australian Open Finale in drei Sätzen | 0.72 |
| A | Bild | [Foto von Spieler, der Trophäe hält und lächelt] | 0.31 |
| B | Text | Wetterbedingte Verzögerungen beeinträchtigen den Zeitplan für Freiluftturniere | 0.23 |
| B | Bild | [Foto von Tennisspielern, die springen und feiern] | 0.54 |
Welcher Artikel ist relevanter? Artikel A hat einen hohen Textwert, aber einen niedrigen Bildwert. Artikel B hat einen niedrigen Textwert, aber einen höheren Bildwert. Die grundlegende Herausforderung besteht darin, dass man 0.72 (Text) nicht mit 0.54 (Bild) vergleichen kann, da diese Ähnlichkeitswerte auf völlig unterschiedlichen Skalen liegen.
tagWenn triviale Lösungen scheitern

Aufgrund der Modalitätslücke in jina-clip-v2 oder in fast allen anderen CLIP-ähnlichen Modellen funktioniert kein offensichtlicher Ansatz, den Sie möglicherweise versuchen. Wenn Sie nur den höheren Wert verwenden, stoßen Sie auf die Tatsache, dass Textwerte sich um 0.2-0.8 gruppieren, während sich Bildwerte um 0.4-0.6 gruppieren. Das bedeutet, dass eine mittelmäßige Textübereinstimmung (0.6) immer eine ausgezeichnete Bildübereinstimmung (0.5) schlägt.
Das Mitteln der Werte hilft auch nicht. Das Berechnen von (0.7 + 0.3)/2 = 0.5 ergibt eine Zahl, aber was bedeutet sie eigentlich? Sie mitteln grundsätzlich bedeutungslose Größen. Ebenso ist jedes feste Gewichtungsschema willkürlich - manchmal ist Text wichtiger, manchmal Bilder, und dies hängt vollständig von der spezifischen Abfrage und dem Dokument ab.
Selbst das vorherige Normalisieren der Werte löst das Kernproblem nicht. Sie versuchen immer noch, grundsätzlich unterschiedliche Ähnlichkeitsmaße zu kombinieren, die unterschiedliche Aspekte der Relevanz erfassen.
tagWas tatsächlich passiert

Um eine bessere Vorstellung davon zu bekommen, womit wir es zu tun haben, hier ein Beispieldokument aus dem EDIS-Datensatz, das das Bild (ein deutsches Fußballspiel) und die Bildunterschrift zeigt (One More Field Where the Content Trails Germany).

Insgesamt zeigt jina-clip-v2 viel höhere Ähnlichkeiten beim Vergleich von Abfrage zu Text als von Abfrage zu Bild im EDIS-Datensatz, zum Teil aufgrund der Art und Weise, wie das Modell trainiert wurde, und zum Teil aufgrund des Datensatzes selbst:

Daher erscheint es logisch, ein Dokument anhand seines Textes und nicht anhand seines Bildes abzurufen. Und wie wir in der folgenden Grafik sehen können, erhalten wir viel bessere Ergebnisse, wenn wir die Textabfrage ... for undocumented immigrants helping to establish legal status in the United States mit den Textinhalten des Korpus vergleichen. Tatsächlich schlägt die Suche nach Bildern fehl, um das Ground-Truth-Dokument (gelb hervorgehoben) überhaupt abzurufen:

top_k von 3 verwendet wird.Aber lassen Sie sich nicht täuschen. Obwohl Abfrage zu Text höhere Ähnlichkeitswerte aufweist, sind Abfrage zu Text- und Abfrage zu Bild-Ähnlichkeitswerte nicht vergleichbar. Dies können wir sehen, wenn wir Recall@10 betrachten, wenn wir jina-clip-v2 verwenden, um 32 Dokumente aus dem EDIS-Datensatz abzurufen. Offensichtlich ist der Recall bei Abfrage zu Bild höher:
| Recall@10 | |
|---|---|
| Abfrage zu Text | 14.55 |
| Abfrage zu Bild | 22.38 |
Wir können dies unten sehen: Wenn wir eine Abfrage aus dem Datensatz verwenden, Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi., können wir das Ground-Truth-Dokument nur durch seinen Bildinhalt abrufen. Die Suche nach seinem Textinhalt liefert keine Übereinstimmungen:

top_k von 3 verwendet wird.Wenn also Ähnlichkeitswerte implizieren, dass wir Dokumente aus ihrem Text abrufen sollten, und Recall impliziert, dass wir sie aus ihren Bildern abrufen sollten, was sollten wir wählen? Die Abbildungen 3 und 4 deuten sicherlich nicht auf einen klaren Gewinner hin. Welche Modalität stellt wirklich die engste Übereinstimmung zwischen unserer Abfrage und dem Dokument dar, das wir suchen? Und wenn wir Kandidaten sowohl aus der Query-to-Text- als auch aus der Query-to-Image-Abfrage zusammenführen wollen, wie können wir dann sinnvoll die Top-Übereinstimmungen auswählen, wenn wir nicht einmal Werte vergleichen können? Es ist klar, dass die bloße Verwendung von jina-clip-v2 nicht ausreicht. Wir müssen ein weiteres Modell in den Mix werfen.
tagEine einfache zweistufige Pipeline
Im April 2025 haben wir jina-reranker-m0 veröffentlicht, einen mehrsprachigen multimodalen 重排器 (Reranker) zum Abrufen visueller Dokumente. Wir können die geringere Modalitätslücke unten sehen, wobei jina-reranker-m0 vergleichbare Query-to-Text- und Query-to-Image-Ähnlichkeitswerte aufweist, im Gegensatz zu der viel größeren Lücke, die von jina-clip-v2 gezeigt wird:

Vor diesem Hintergrund können wir jina-reranker-m0 für einen zweiten Durchgang in der Abfragekette verwenden, nachdem die ersten Ergebnisse von jina-clip-v2 abgerufen wurden:
Phase 1: Abrufen von Kandidaten aus beiden Modalitäten
- Verwenden Sie jina-clip-v2, um 16 Dokumente per Textsuche + 16 per Bildsuche zu erhalten.
- Akzeptieren Sie, dass wir die Werte noch nicht vergleichen können.
Phase 2: Einheitliches Reranking
- Führen Sie jedes (Abfrage + vollständiges Dokument)-Paar in jina-reranker-m0 ein.
- Der Reranker verarbeitet sowohl Text ALS auch Bild zusammen.
- Ausgabe: Einzelner Relevanzwert auf einer einheitlichen Skala

Wir haben die Experimente aus Tabelle 1 erweitert und verwenden nun jina-clip-v2, um Dokumente aus dem Korpus abzurufen, und dann jina-reranker-m0, um sie neu zu ordnen:
- Rufen Sie 32 Dokumente per Query-to-Text ab und ordnen Sie sie dann basierend auf dem Query-to-Text-Wert neu.
- Rufen Sie 32 Dokumente per Query-to-Image ab und ordnen Sie sie dann basierend auf dem Query-to-Image-Wert neu.
- Rufen Sie 16 Dokumente per Query-to-Text und 16 per Query-to-Image ab. Neusortierung basierend auf dem Query-to-Text- oder Query-to-Image-Wert, abhängig von der Abfragemodalität.
- Rufen Sie 16 Dokumente per Query-to-Text und 16 per Query-to-Image ab. Neusortierung basierend auf dem durchschnittlichen Query-to-Text- und Query-to-Image-Wert jedes Dokuments, was einen Endwert von (Query-to-Text + Query-to-Image)/2 ergibt.
| Experiment | Beschreibung | Recall@10 - mit jina-clip-v2 | Recall@10 - mit jina-reranker-m0 |
|---|---|---|---|
| 1 | 32 Dokumente: Query-to-Text | 14.55 | 17.42 |
| 2 | 32 Dokumente: Query-to-Image | 22.38 | 28.94 |
| 3 | 16 Dokumente: Query-to-Text 16 Dokumente: Query-to-Image |
14.55 | 33.81 |
| 4 | 16 Dokumente: Query-to-Text 16 Dokumente: Query-to-Image Kombinierte durchschnittliche Reranker-Werte |
14.55 | 36.24 |
Wie wir sehen können, steigt der Recall durch die Durchführung eines zweiten Durchgangs mit jina-reranker-m0 durchweg, unabhängig von der Modalität. Die größte Steigerung sehen wir jedoch, wenn wir sowohl Text- als auch Bildinhalte aus den abgerufenen Dokumenten kombinieren und einen Recall@10 von 36,24 erreichen. Ein visuelles Beispiel zeigt, dass jina-reranker-m0 das Ground-Truth-Dokument konsistent als erstes einstuft, unabhängig davon, ob Text- oder Bildinhalte gesucht werden:

top_k von 1 Ergebnis für jede Reranking-Methodik (vier Spalten rechts), die zeigt, dass die Kombination von Bild- und Textähnlichkeitswerten das Ground-Truth-Dokument konsistent als erstes einstuft.top_k von 3 für die verschiedenen Abfragemethoden zeigen, zeigt Abbildung 7 aus Platzgründen nur einen top_k von 1 für jede Abfrage.tagSchlussfolgerungen
Dieser einfache zweistufige Ansatz führt zu einer Verbesserung des Recall um 62 %, da das System endlich das nutzt, was Menschen auf natürliche Weise tun: sowohl das, was wir lesen, als auch das, was wir sehen, berücksichtigen, um die Relevanz zu bestimmen. Die Lektion geht über die Suche hinaus: Bei multimodalen KI-Systemen werden Single-Pass-Ansätze, die Modalitäten getrennt behandeln, immer auf diese Inkompatibilitätsmauer stoßen. Zweistufige Architekturen, die breit gefächert abrufen und dann intelligent einstufen, werden immer wichtiger. Testen Sie jina-reranker-m0 über unsere API oder auf AWS, GCP und Azure.








