Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Wenn triviale Lösungen scheitern
Was tatsächlich passiert
Eine einfache zweistufige Pipeline
Schlussfolgerungen
Tech-Blog
Mai 25, 2025

Faires Scoring für Multimodale Dokumente mit jina-reranker-m0

Textähnlichkeit: 0.7. Bildähnlichkeit: 0.5. Welches Dokument ist relevanter? Sie können es buchstäblich nicht sagen – und das ist das Kernproblem, das die multimodale Suche behindert. Wir lösen es mit Unified Reranking (einheitlicher Reranker).
Nan Wang, Alex C-G • 8 Minuten gelesen

Stellen Sie sich vor, Sie entwickeln ein Suchsystem für Sportnachrichten. Ein Benutzer sucht nach "Tennispieler feiern Meisterschaftssieg", und Sie müssen die relevantesten Artikel aus Ihrer Datenbank finden. Jeder Artikel enthält sowohl eine Textunterschrift als auch ein Bild - typisch für moderne Sportberichterstattung.

Ihr System muss eine Textabfrage entgegennehmen und eine Rangliste der relevantesten multimodalen Dokumente aus Ihrem Korpus zurückgeben. Klingt unkompliziert, aber es gibt ein grundlegendes Problem, das alle offensichtlichen Ansätze zunichte macht.

Folgendes passiert, wenn Sie versuchen, diese Dokumente zu bewerten. Ihr 向量模型 (Embedding)-Modell, sagen wir jina-clip-v2, erzeugt Ähnlichkeitswerte wie diese:

Artikel Inhaltstyp Beschreibung Ähnlichkeitswert
A Text Novak Djokovic gewinnt Australian Open Finale in drei Sätzen 0.72
A Bild [Foto von Spieler, der Trophäe hält und lächelt] 0.31
B Text Wetterbedingte Verzögerungen beeinträchtigen den Zeitplan für Freiluftturniere 0.23
B Bild [Foto von Tennisspielern, die springen und feiern] 0.54

Welcher Artikel ist relevanter? Artikel A hat einen hohen Textwert, aber einen niedrigen Bildwert. Artikel B hat einen niedrigen Textwert, aber einen höheren Bildwert. Die grundlegende Herausforderung besteht darin, dass man 0.72 (Text) nicht mit 0.54 (Bild) vergleichen kann, da diese Ähnlichkeitswerte auf völlig unterschiedlichen Skalen liegen.

tagWenn triviale Lösungen scheitern

The What and Why of Text-Image Modality Gap in CLIP Models
You can’t just use a CLIP model to retrieve text and images and sort the results by score. Why? Because of the modality gap. What is it, and where does it come from?
Jina AIBo Wang, Scott Martens

Aufgrund der Modalitätslücke in jina-clip-v2 oder in fast allen anderen CLIP-ähnlichen Modellen funktioniert kein offensichtlicher Ansatz, den Sie möglicherweise versuchen. Wenn Sie nur den höheren Wert verwenden, stoßen Sie auf die Tatsache, dass Textwerte sich um 0.2-0.8 gruppieren, während sich Bildwerte um 0.4-0.6 gruppieren. Das bedeutet, dass eine mittelmäßige Textübereinstimmung (0.6) immer eine ausgezeichnete Bildübereinstimmung (0.5) schlägt.

Das Mitteln der Werte hilft auch nicht. Das Berechnen von (0.7 + 0.3)/2 = 0.5 ergibt eine Zahl, aber was bedeutet sie eigentlich? Sie mitteln grundsätzlich bedeutungslose Größen. Ebenso ist jedes feste Gewichtungsschema willkürlich - manchmal ist Text wichtiger, manchmal Bilder, und dies hängt vollständig von der spezifischen Abfrage und dem Dokument ab.

Selbst das vorherige Normalisieren der Werte löst das Kernproblem nicht. Sie versuchen immer noch, grundsätzlich unterschiedliche Ähnlichkeitsmaße zu kombinieren, die unterschiedliche Aspekte der Relevanz erfassen.

tagWas tatsächlich passiert

EDIS: Entity-Driven Image Search over Multimodal Web Content
Making image retrieval methods practical for real-world search applications requires significant progress in dataset scales, entity comprehension, and multimodal information fusion. In this work, we introduce \textbf{E}ntity-\textbf{D}riven \textbf{I}mage \textbf{S}earch (EDIS), a challenging dataset for cross-modal image search in the news domain. EDIS consists of 1 million web images from actual search engine results and curated datasets, with each image paired with a textual description. Unlike datasets that assume a small set of single-modality candidates, EDIS reflects real-world web image search scenarios by including a million multimodal image-text pairs as candidates. EDIS encourages the development of retrieval models that simultaneously address cross-modal information fusion and matching. To achieve accurate ranking results, a model must: 1) understand named entities and events from text queries, 2) ground entities onto images or text descriptions, and 3) effectively fuse textual and visual representations. Our experimental results show that EDIS challenges state-of-the-art methods with dense entities and a large-scale candidate set. The ablation study also proves that fusing textual features with visual features is critical in improving retrieval results.
arXiv.orgSiqi Liu

Um eine bessere Vorstellung davon zu bekommen, womit wir es zu tun haben, hier ein Beispieldokument aus dem EDIS-Datensatz, das das Bild (ein deutsches Fußballspiel) und die Bildunterschrift zeigt (One More Field Where the Content Trails Germany).

Abbildung 1: Beispiel für ein multimodales Dokument, das sowohl Bild- als auch Textinhalte enthält. Da wir zwei Modalitäten haben, gibt es für jede gegebene Abfrage nun zwei semantische Lücken (zwischen der Abfrage und dem Text sowie zwischen der Abfrage und dem Bild). Um die besten Ergebnisse zu erzielen, sollten wir den Textinhalt der Dokumente oder den Bildinhalt durchsuchen?

Insgesamt zeigt jina-clip-v2 viel höhere Ähnlichkeiten beim Vergleich von Abfrage zu Text als von Abfrage zu Bild im EDIS-Datensatz, zum Teil aufgrund der Art und Weise, wie das Modell trainiert wurde, und zum Teil aufgrund des Datensatzes selbst:

Abbildung 2: Ähnlichkeitswerte zwischen Abfrage zu Bild (rot) und Abfrage zu Text (blau) bei Verwendung von jina-clip-v2.

Daher erscheint es logisch, ein Dokument anhand seines Textes und nicht anhand seines Bildes abzurufen. Und wie wir in der folgenden Grafik sehen können, erhalten wir viel bessere Ergebnisse, wenn wir die Textabfrage ... for undocumented immigrants helping to establish legal status in the United States mit den Textinhalten des Korpus vergleichen. Tatsächlich schlägt die Suche nach Bildern fehl, um das Ground-Truth-Dokument (gelb hervorgehoben) überhaupt abzurufen:

Abbildung 3: Beispiel, bei dem das Ground-Truth-Dokument (mit gelbem Rand hervorgehoben) nur über jina-clip-v2's Abfrage-zu-Text-Abruf abgerufen werden kann, wenn top_k von 3 verwendet wird.

Aber lassen Sie sich nicht täuschen. Obwohl Abfrage zu Text höhere Ähnlichkeitswerte aufweist, sind Abfrage zu Text- und Abfrage zu Bild-Ähnlichkeitswerte nicht vergleichbar. Dies können wir sehen, wenn wir Recall@10 betrachten, wenn wir jina-clip-v2 verwenden, um 32 Dokumente aus dem EDIS-Datensatz abzurufen. Offensichtlich ist der Recall bei Abfrage zu Bild höher:

Recall@10
Abfrage zu Text 14.55
Abfrage zu Bild 22.38

Wir können dies unten sehen: Wenn wir eine Abfrage aus dem Datensatz verwenden, Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi., können wir das Ground-Truth-Dokument nur durch seinen Bildinhalt abrufen. Die Suche nach seinem Textinhalt liefert keine Übereinstimmungen:

Abbildung 4: Beispiel, bei dem das Ground-Truth-Dokument (mit gelbem Rand hervorgehoben) nur über jina-clip-v2's Abfrage-zu-Bild-Abruf abgerufen werden kann, wenn top_k von 3 verwendet wird.

Wenn also Ähnlichkeitswerte implizieren, dass wir Dokumente aus ihrem Text abrufen sollten, und Recall impliziert, dass wir sie aus ihren Bildern abrufen sollten, was sollten wir wählen? Die Abbildungen 3 und 4 deuten sicherlich nicht auf einen klaren Gewinner hin. Welche Modalität stellt wirklich die engste Übereinstimmung zwischen unserer Abfrage und dem Dokument dar, das wir suchen? Und wenn wir Kandidaten sowohl aus der Query-to-Text- als auch aus der Query-to-Image-Abfrage zusammenführen wollen, wie können wir dann sinnvoll die Top-Übereinstimmungen auswählen, wenn wir nicht einmal Werte vergleichen können? Es ist klar, dass die bloße Verwendung von jina-clip-v2 nicht ausreicht. Wir müssen ein weiteres Modell in den Mix werfen.

tagEine einfache zweistufige Pipeline

Im April 2025 haben wir jina-reranker-m0 veröffentlicht, einen mehrsprachigen multimodalen 重排器 (Reranker) zum Abrufen visueller Dokumente. Wir können die geringere Modalitätslücke unten sehen, wobei jina-reranker-m0 vergleichbare Query-to-Text- und Query-to-Image-Ähnlichkeitswerte aufweist, im Gegensatz zu der viel größeren Lücke, die von jina-clip-v2 gezeigt wird:

Abbildung 6: Im Vergleich zu jina-clip-v2 zeigt jina-reranker-m0 einen viel geringeren Unterschied zwischen Query-to-Image- (rot) und Query-to-Text- (blau) Ähnlichkeitswerten.

Vor diesem Hintergrund können wir jina-reranker-m0 für einen zweiten Durchgang in der Abfragekette verwenden, nachdem die ersten Ergebnisse von jina-clip-v2 abgerufen wurden:

Phase 1: Abrufen von Kandidaten aus beiden Modalitäten

  • Verwenden Sie jina-clip-v2, um 16 Dokumente per Textsuche + 16 per Bildsuche zu erhalten.
  • Akzeptieren Sie, dass wir die Werte noch nicht vergleichen können.

Phase 2: Einheitliches Reranking

  • Führen Sie jedes (Abfrage + vollständiges Dokument)-Paar in jina-reranker-m0 ein.
  • Der Reranker verarbeitet sowohl Text ALS auch Bild zusammen.
  • Ausgabe: Einzelner Relevanzwert auf einer einheitlichen Skala
Abbildung 5: Indizieren multimodaler Dokumente und ein zweistufiger multimodaler Abfrageprozess mit jina-clip-v2 und jina-reranker-m0.

Wir haben die Experimente aus Tabelle 1 erweitert und verwenden nun jina-clip-v2, um Dokumente aus dem Korpus abzurufen, und dann jina-reranker-m0, um sie neu zu ordnen:

  1. Rufen Sie 32 Dokumente per Query-to-Text ab und ordnen Sie sie dann basierend auf dem Query-to-Text-Wert neu.
  2. Rufen Sie 32 Dokumente per Query-to-Image ab und ordnen Sie sie dann basierend auf dem Query-to-Image-Wert neu.
  3. Rufen Sie 16 Dokumente per Query-to-Text und 16 per Query-to-Image ab. Neusortierung basierend auf dem Query-to-Text- oder Query-to-Image-Wert, abhängig von der Abfragemodalität.
  4. Rufen Sie 16 Dokumente per Query-to-Text und 16 per Query-to-Image ab. Neusortierung basierend auf dem durchschnittlichen Query-to-Text- und Query-to-Image-Wert jedes Dokuments, was einen Endwert von (Query-to-Text + Query-to-Image)/2 ergibt.
💡
Beachten Sie, dass wir die Zero-Shot-Leistung auf EDIS messen. Wir haben weder jina-clip-v2 noch jina-reranker-m0 mit dem Datensatz feinabgestimmt.
Experiment Beschreibung Recall@10 - mit jina-clip-v2 Recall@10 - mit jina-reranker-m0
1 32 Dokumente: Query-to-Text 14.55 17.42
2 32 Dokumente: Query-to-Image 22.38 28.94
3 16 Dokumente: Query-to-Text
16 Dokumente: Query-to-Image
14.55 33.81
4 16 Dokumente: Query-to-Text
16 Dokumente: Query-to-Image
Kombinierte durchschnittliche Reranker-Werte
14.55 36.24
💡
Die Experimente 1, 3 und 4 zeigen alle das gleiche Ergebnis für Recall@10 mit jina-clip-v2, da die Query-to-Text-Werte höher sind als die Query-to-Image-Werte. Daher werden die Top-Ten-Ergebnisse von den per Text abgerufenen Dokumenten dominiert.

Wie wir sehen können, steigt der Recall durch die Durchführung eines zweiten Durchgangs mit jina-reranker-m0 durchweg, unabhängig von der Modalität. Die größte Steigerung sehen wir jedoch, wenn wir sowohl Text- als auch Bildinhalte aus den abgerufenen Dokumenten kombinieren und einen Recall@10 von 36,24 erreichen. Ein visuelles Beispiel zeigt, dass jina-reranker-m0 das Ground-Truth-Dokument konsistent als erstes einstuft, unabhängig davon, ob Text- oder Bildinhalte gesucht werden:

Abbildung 7: Beispielabfragen (links) und top_k von 1 Ergebnis für jede Reranking-Methodik (vier Spalten rechts), die zeigt, dass die Kombination von Bild- und Textähnlichkeitswerten das Ground-Truth-Dokument konsistent als erstes einstuft.
💡
Während die Abbildungen 3 und 4 einen top_k von 3 für die verschiedenen Abfragemethoden zeigen, zeigt Abbildung 7 aus Platzgründen nur einen top_k von 1 für jede Abfrage.

tagSchlussfolgerungen

Dieser einfache zweistufige Ansatz führt zu einer Verbesserung des Recall um 62 %, da das System endlich das nutzt, was Menschen auf natürliche Weise tun: sowohl das, was wir lesen, als auch das, was wir sehen, berücksichtigen, um die Relevanz zu bestimmen. Die Lektion geht über die Suche hinaus: Bei multimodalen KI-Systemen werden Single-Pass-Ansätze, die Modalitäten getrennt behandeln, immer auf diese Inkompatibilitätsmauer stoßen. Zweistufige Architekturen, die breit gefächert abrufen und dann intelligent einstufen, werden immer wichtiger. Testen Sie jina-reranker-m0 über unsere API oder auf AWS, GCP und Azure.

Kategorien:
Tech-Blog
rss_feed

Weiterlesen
März 11, 2026 • 7 Minuten gelesen
Bootstrapping Audio Embeddings from Multimodal LLMs
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
März 06, 2026 • 6 Minuten gelesen
Identifying Embedding Models from Raw Numerical Values
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
September 09, 2025 • 11 Minuten gelesen
Multimodal Embeddings in Llama.cpp and GGUF
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.