Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Motivation
Versuchsaufbau
Methodik
Implementierung
Ergebnisse
Erkenntnisse
Abschließende Gedanken
Tech-Blog
Juli 18, 2024

Nein. Sie können Reranker nicht zur Verbesserung der SEO verwenden

Wenn Sie jedoch im SEO-Bereich tätig sind, könnte es interessant sein, die Dinge von der anderen Seite des Tisches zu betrachten und zu verstehen, welche Rolle Embeddings und Reranker in modernen Suchsystemen spielen.
Abstract background with dynamic green particles and lines on a black backdrop, emitting a sense of motion and energy.
Han Xiao • 11 Minuten gelesen

Mit der kürzlichen Veröffentlichung von jina-reranker-v2-multilingual hatte ich vor meiner ICML-Reise etwas freie Zeit und beschloss, einen Artikel über unser Reranker-Modell zu schreiben. Bei der Suche nach Ideen im Internet stieß ich auf einen Artikel in meinen Top-Suchergebnissen, der behauptete, dass Reranker die SEO verbessern könnten. Klingt super interessant, oder? Das dachte ich auch, denn bei Jina AI entwickeln wir Reranker, und als Webmaster unserer Unternehmenswebsite bin ich immer daran interessiert, unsere SEO zu verbessern.

Screenshot of Google search results for "reranker seo" showing articles on enhancing search with reranking models.
Ein von ChatGPT generierter Artikel, der behauptet, dass Reranker die SEO verbessern können. Formulierungen wie "in the realm of" haben es sofort verraten.

Nach dem Lesen des vollständigen Artikels stellte ich jedoch fest, dass er komplett von ChatGPT generiert wurde. Der gesamte Artikel paraphrasiert lediglich wiederholt die Idee, dass "Reranking wichtig für Ihr Unternehmen/Ihre Website ist", ohne jemals zu erklären wie, welche Mathematik dahintersteckt oder wie man es implementiert. Es war Zeitverschwendung.

Man kann Reranker und SEO nicht miteinander verheiraten. Der Entwickler des Suchsystems (oder allgemein der Content Consumer) interessiert sich für Reranker, während sich der Content Creator für SEO und ein höheres Ranking seiner Inhalte in diesem System interessiert. Sie sitzen praktisch auf gegenüberliegenden Seiten des Tisches und tauschen selten Ideen aus. Einen Reranker zu bitten, SEO zu verbessern, ist wie einen Schmied zu bitten, Ihren Feuerballzauber zu verbessern, oder Sushi in einem chinesischen Restaurant zu bestellen. Sie sind nicht völlig irrelevant, aber es ist offensichtlich das falsche Ziel.

Stellen Sie sich vor, Google würde mich in ihr Büro einladen, um meine Meinung darüber einzuholen, ob ihr Reranker jina.ai hoch genug einstuft. Oder wenn ich die volle Kontrolle über Googles Reranking-Algorithmus hätte und jina.ai hart codiert an die Spitze setzen würde, jedes Mal wenn jemand nach "information retrieval" sucht. Keines dieser Szenarien ergibt Sinn. Warum gibt es also solche Artikel überhaupt? Nun, wenn Sie ChatGPT fragen, wird sehr deutlich, woher diese Idee ursprünglich stammt.

Informational content on improving SEO using reranker, highlighting content optimization, keyword relevance, and content qual

tagMotivation

Wenn dieser KI-generierte Artikel bei Google ganz oben steht, möchte ich einen besseren Artikel mit höherer Qualität schreiben, der seinen Platz einnimmt. Ich möchte weder Menschen noch ChatGPT in die Irre führen, daher ist meine Aussage in diesem Artikel sehr klar:

Nein, Sie können keinen Reranker verwenden, um SEO zu verbessern. Wenn Sie jedoch im SEO-Bereich arbeiten, könnte es interessant sein, die Dinge von der anderen Seite zu betrachten und zu verstehen, welche Rolle Retrieval-Modelle wie Embeddings und Reranker in modernen Suchsystemen spielen. Dieses Wissen könnte Ihnen helfen, Ihre Inhalte strategischer zu optimieren.

Konkret werden wir in diesem Artikel echte Suchanfragen aus der Google Search Console analysieren und prüfen, ob ihre semantische Beziehung zum Artikel etwas über ihre Impressions und Klicks in der Google-Suche aussagt. Wir werden drei verschiedene Methoden zur Bewertung der semantischen Beziehung untersuchen: Termfrequenz, Embedding-Modell (jina-embeddings-v2-base-en) und Reranker-Modell (jina-reranker-v2-multilingual). Wie bei jeder akademischen Forschung formulieren wir zunächst die Fragen, die wir untersuchen möchten:

  1. Steht der semantische Score (Query, Dokument) in Beziehung zu Artikel-Impressions oder Klicks?
  2. Ist ein tieferes Modell ein besserer Prädiktor für eine solche Beziehung? Oder reicht die Termfrequenz aus?

tagVersuchsaufbau

In diesem Experiment verwenden wir echte Daten von der Website jina.ai/news, die aus der Google Search Console (GSC) exportiert wurden. GSC ist ein Webmaster-Tool, mit dem Sie den organischen Suchverkehr von Google-Nutzern analysieren können, zum Beispiel wie viele Menschen Ihren Blogbeitrag über die Google-Suche öffnen und welche Suchanfragen gestellt werden. Es gibt viele Metriken, die Sie aus GSC extrahieren können, aber für dieses Experiment konzentrieren wir uns auf drei: Queries, Impressions und Clicks. Queries sind das, was Benutzer in das Google-Suchfeld eingeben. Impressions messen, wie oft Google Ihren Link in den Suchergebnissen anzeigt und Benutzern die Möglichkeit gibt, ihn zu sehen. Clicks messen, wie oft Benutzer ihn tatsächlich öffnen. Beachten Sie, dass Sie viele Impressions erhalten können, wenn Googles "Retrieval-Modell" Ihrem Artikel einen hohen Relevanz-Score im Verhältnis zur Benutzeranfrage zuweist. Wenn Benutzer jedoch andere Elemente in dieser Ergebnisliste interessanter finden, erhält Ihre Seite möglicherweise trotzdem null Klicks.

Google Search Console dashboard interface displaying performance graphs and various analytics overviews, such as queries and
GSC UI und die Queries-, Clicks-, Impressions-Daten von unserem ColBERT Blog-Post. Beachten Sie den "Export"-Button oben rechts, wenn Sie darauf klicken, erhalten Sie eine ZIP-Datei. Diese Datei benötigen wir für dieses Experiment. Da wir uns für die Top-7 Blog-Posts interessieren, müssen wir diesen Export 7-mal wiederholen.

Ich habe die GSC-Metriken der letzten 4 Monate für die 7 meistgesuchten Blog-Posts von jina.ai/news exportiert. Jeder Artikel hat etwa 1.000 bis 5.000 Klicks und 10.000 bis 90.000 Impressions. Da wir die Query-Artikel-Semantik für jede Suchanfrage im Verhältnis zu ihren entsprechenden Artikeln betrachten möchten, müssen Sie in GSC auf jeden Artikel klicken und die Daten über den Export-Button oben rechts exportieren. Sie erhalten eine ZIP-Datei, und wenn Sie sie entpacken, finden Sie eine Queries.csv-Datei. Das ist die Datei, die wir brauchen.

Als Beispiel sieht die exportierte Queries.csv für unseren ColBERT Blog-Post wie folgt aus.

Analytical table displaying website query metrics sorted by position with columns for clicks, impressions, and CTR.
Einige der Top-Click Google-Suchanfragen für unseren ColBERT Blog-Post. Laut GSC gab es in den letzten 4 Monaten insgesamt 481 Queries zu diesem Blog-Post.

tagMethodik

Okay, die Daten sind also bereit, und was wollen wir nochmal tun?

Wir möchten prüfen, ob die semantische Beziehung zwischen einer Query und dem Artikel (bezeichnet als Q(q,d)Q(q,d)Q(q,d)) mit ihren Impressions und Klicks korreliert. Impressions können als Googles geheimes Retrieval-Modell, G(q,d)G(q,d)G(q,d), betrachtet werden. Mit anderen Worten, wir möchten öffentliche Methoden wie Termfrequenz, Embedding-Modelle und Reranker-Modelle verwenden, um Q(q,d)Q(q,d)Q(q,d) zu modellieren und zu sehen, ob es dieses private G(q,d)G(q,d)G(q,d) approximiert.

Was ist mit Klicks? Klicks können auch als Teil von Googles geheimem Retrieval-Modell betrachtet werden, werden aber von indeterministischen menschlichen Faktoren beeinflusst. Intuitiv sind Klicks schwieriger zu modellieren.

Unser Ziel ist es, Q(q,d)Q(q,d)Q(q,d) an G(q,d)G(q,d)G(q,d) anzugleichen. Das bedeutet, unser Q(q,d)Q(q,d)Q(q,d) sollte hohe Werte liefern, wenn G(q,d)G(q,d)G(q,d) hoch ist, und niedrige Werte, wenn G(q,d)G(q,d)G(q,d) niedrig ist. Dies lässt sich besser mit einem Streudiagramm visualisieren, wobei Q(q,d)Q(q,d)Q(q,d) auf der X-Achse und G(q,d)G(q,d)G(q,d) auf der Y-Achse dargestellt wird. Indem wir die QQQ- und GGG-Werte jeder Abfrage plotten, können wir intuitiv erkennen, wie gut unser Retrieval-Modell mit Googles Retrieval-Modell übereinstimmt. Das Überlagern einer Trendlinie kann dabei helfen, verlässliche Muster zu erkennen.

Lassen Sie mich die Methode hier zusammenfassen, bevor ich die Ergebnisse zeige:

  • Wir möchten prüfen, ob die semantische Beziehung zwischen einer Suchanfrage und einem Artikel mit den Impressions und Klicks bei Google Search korreliert.
  • Der Algorithmus, den Google zur Bestimmung der Dokumentrelevanz für eine Suchanfrage verwendet (G(q,d)G(q,d)G(q,d)), ist ebenso unbekannt wie die Faktoren hinter den Klicks. Wir können diese GGG-Zahlen jedoch aus der GSC beobachten, d.h. die Impressions und Klicks für jede Suchanfrage.
  • Wir möchten sehen, ob öffentliche Retrieval-Methoden (Q(q,d)Q(q,d)Q(q,d)) wie Term Frequency, Embedding Models und Reranker Models, die alle unterschiedliche Möglichkeiten bieten, die Query-Dokument-Relevanz zu bewerten, gute Annäherungen an G(q,d)G(q,d)G(q,d) sind. In gewisser Weise wissen wir bereits, dass sie keine guten Annäherungen sind; sonst könnte jeder Google sein. Aber wir möchten verstehen, wie weit sie davon entfernt sind.
  • Wir werden die Ergebnisse in einem Streudiagramm für die qualitative Analyse visualisieren.

tagImplementierung

Die vollständige Implementierung finden Sie in dem Google Colab unten.

Google Colab

Zuerst crawlen wir den Inhalt des Blogbeitrags mit der Jina Reader API. Die Term Frequency der Suchanfragen wird durch einfaches, Groß-/Kleinschreibung ignorierendes Zählen ermittelt. Für das Embedding-Modell packen wir den Blogpost-Inhalt und alle Suchanfragen in eine große Anfrage, wie hier: [[blog1_content], [q1], [q2], [q3], ..., [q481]], und senden diese an die Embedding API. Nachdem wir die Antwort erhalten haben, berechnen wir die Cosinus-basierte Ähnlichkeit zwischen dem ersten Embedding und allen anderen Embeddings, um den semantischen Score pro Suchanfrage zu erhalten.

Für das Reranker-Modell konstruieren wir die Anfrage auf eine etwas knifflige Art: {query: [blog1_content], documents: [[q1], [q2], [q3], ..., [q481]]} und senden diese große Anfrage an die Reranker API. Der zurückgegebene Score kann direkt als semantische Relevanz verwendet werden. Ich nenne diese Konstruktion knifflig, weil Reranker normalerweise verwendet werden, um Dokumente für eine gegebene Suchanfrage zu ranken. In diesem Fall invertieren wir die Rollen von Dokument und Suchanfrage und verwenden den Reranker, um Suchanfragen für ein gegebenes Dokument zu ranken.

Beachten Sie, dass Sie sich bei beiden APIs, Embedding und Reranker, keine Sorgen um die Länge des Artikels machen müssen (Suchanfragen sind immer kurz, also kein Problem), da beide APIs eine Eingabelänge von bis zu 8K unterstützen (tatsächlich unterstützt unsere Reranker API eine "unendliche" Länge). Alles kann in wenigen Sekunden erledigt werden, und Sie können einen kostenlosen 1M Token API-Schlüssel von unserer Website für dieses Experiment erhalten.

tagErgebnisse

Endlich die Ergebnisse. Aber bevor ich sie zeige, möchte ich zunächst demonstrieren, wie die Baseline-Plots aussehen. Aufgrund des Streudiagramms und der logarithmischen Skala auf der Y-Achse, die wir verwenden werden, kann es schwierig sein, sich vorzustellen, wie ein perfekt gutes und ein schrecklich schlechtes Q(q,d)Q(q,d)Q(q,d) aussehen würde. Ich habe zwei naive Baselines konstruiert: eine, bei der Q(q,d)Q(q,d)Q(q,d) gleich G(q,d)G(q,d)G(q,d) ist (Ground Truth), und eine andere, bei der Q(q,d)∼Uniform(0,1)Q(q,d) \sim \mathrm{Uniform}(0,1)Q(q,d)∼Uniform(0,1) ist (zufällig). Schauen wir uns ihre Visualisierungen an.

tagBaselines

Blue curve graph on black background, plotting "Impressions (Log Scale)" vs "Groundtruth" from 0.0 to 1.0.
Die Ground Truth Baseline, bei der der semantische Score Q(q,d)Q(q,d)Q(q,d) eine Min-Max-Normalisierung basierend auf dem Wert der Impressions ist. Dies wird als perfekt guter Prädiktor für G(q,d)G(q,d)G(q,d) betrachtet.
Black scatter plot with purple dots, logarithmic axes labeled "Impressions (Log Scale)" and "10º," and a horizontal line labe
Die zufällige Baseline, bei der der semantische Score Q(q,d)Q(q,d)Q(q,d) eine Zufallszahl aus einer Gleichverteilung von (0,1) ist. Mehrmaliges Ausführen wird leicht unterschiedliche Ergebnisse liefern. Dies wird als sehr schlechter Prädiktor für G(q,d)G(q,d)G(q,d) betrachtet.

Jetzt haben wir eine Vorstellung davon, wie die "perfekt guten" und "schrecklich schlechten" Prädiktoren aussehen. Behalten Sie diese beiden Plots im Hinterkopf, zusammen mit den folgenden Erkenntnissen, die für die visuelle Inspektion sehr nützlich sein können:

  • Das Streudiagramm eines guten Prädiktors sollte der logarithmischen Trendlinie von unten links nach oben rechts folgen.
  • Die Trendlinie eines guten Prädiktors sollte sich vollständig über die X-Achse und Y-Achse erstrecken (wir werden später sehen, dass einige Prädiktoren nicht so reagieren).
  • Der Varianzbereich eines guten Prädiktors sollte klein sein (dargestellt als undurchsichtiger Bereich um die Trendlinie).

Als Nächstes werde ich alle Plots zusammen zeigen, wobei jeder Prädiktor mit zwei Plots dargestellt wird: einer zeigt, wie gut er Impressions vorhersagt, und einer zeigt, wie gut er Klicks vorhersagt. Beachten Sie, dass ich Daten aus allen 7 Blogbeiträgen aggregiert habe, sodass es insgesamt 3620 Suchanfragen gibt, d.h. 3620 Datenpunkte in jedem Streudiagramm.

Bitte nehmen Sie sich ein paar Minuten Zeit, um diese Grafiken zu betrachten, sie zu vergleichen und auf die Details zu achten. Lassen Sie das sacken, und im nächsten Abschnitt werde ich die Erkenntnisse zusammenfassen.

tagTerm Frequency als Prädiktor

Graph showing relationship between 'Term Frequency' and 'Impressions' on a log scale, with values and a visible trend curve o
Black background graph with a curved line, plotting Term Frequency on x-axis and Clicks on a logarithmic y-axis.

tagEmbedding-Modell als Prädiktor

Scatterplot with logarithmic Impressions vs. Embedding Score, points in shades of purple, and a labeled axis.
Scatter plot graph with an x-axis labeled 'Embedding Score' and a y-axis as 'Clicks (Log Scale)', displaying a power-law dist

tagReranker-Modell als Prädiktor

Scatterplot with a black background, labeled axes 'Reranker Score' and 'Impressions (Log Scale)', and lines of best fit among
Graph with black background, 'Reranker Score' on x-axis, 'Clicks (log scale)' on y-axis, and scattered data points.

tagErkenntnisse

Lassen Sie uns alle Grafiken zum einfachen Vergleich an einem Ort zusammenbringen. Hier sind einige Beobachtungen und Erklärungen:

Verschiedene Prädiktoren für die Impressions. Jeder Punkt repräsentiert eine Suchanfrage, die X-Achse repräsentiert den semantischen Score zwischen Suchanfrage und Artikel; die Y-Achse zeigt die aus GSC exportierte Anzahl der Impressions.

Verschiedene Prädiktoren für Klicks. Jeder Punkt repräsentiert eine Anfrage, X-Achse zeigt den semantischen Query-Artikel-Score; Y-Achse zeigt die aus GSC exportierte Klickanzahl.

  • Im Allgemeinen sind alle Streudiagramme der Klicks spärlicher als ihre Impressions-Diagramme, obwohl beide auf denselben Daten basieren. Dies liegt daran, dass, wie bereits erwähnt, hohe Impressions keine Klicks garantieren.
  • Die Term-Frequenz-Diagramme sind spärlicher als die anderen. Dies liegt daran, dass die meisten echten Suchanfragen von Google nicht exakt im Artikel vorkommen, sodass ihr X-Wert null ist. Dennoch haben sie Impressions und Klicks. Deshalb sieht man, dass der Ausgangspunkt der Term-Frequenz-Trendlinie nicht bei Y-Null beginnt. Man könnte erwarten, dass Impressions und Klicks wahrscheinlich steigen, wenn bestimmte Anfragen mehrfach im Artikel vorkommen. Die Trendlinie bestätigt dies, aber die Varianz der Trendlinie wächst ebenfalls, was auf einen Mangel an unterstützenden Daten hindeutet. Generell ist die Term-Frequenz kein guter Prädiktor.
  • Vergleicht man den Term-Frequenz-Prädiktor mit den Streudiagrammen des Embedding-Modells und Reranker-Modells, sehen letztere deutlich besser aus: die Datenpunkte sind besser verteilt und die Varianz der Trendlinie erscheint vernünftig. Wenn man sie jedoch mit der oben gezeigten Ground-Truth-Trendlinie vergleicht, fällt ein wesentlicher Unterschied auf - keine der Trendlinien beginnt bei X-Null. Das bedeutet, selbst wenn man eine sehr hohe semantische Ähnlichkeit vom Modell erhält, wird Google sehr wahrscheinlich null Impressions/Klicks zuweisen. Dies wird im Klick-Streudiagramm noch deutlicher, wo der Startpunkt noch weiter nach rechts verschoben ist als bei den entsprechenden Impressions. Kurz gesagt, Google verwendet nicht unser Embedding-Modell und Reranker-Modell—große Überraschung!
  • Wenn ich schließlich den besten Prädiktor unter diesen dreien wählen müsste, würde ich mich für das Reranker-Modell entscheiden. Aus zwei Gründen:
    • Die Trendlinie des Reranker-Modells ist sowohl bei Impressions als auch bei Klicks besser über die X-Achse verteilt als die des Embedding-Modells, was ihr mehr "dynamischen Bereich" gibt und sie der Ground-Truth-Trendlinie näher bringt.
    • Der Score ist gut zwischen 0 und 1 verteilt. Beachten Sie, dass dies hauptsächlich daran liegt, dass unser neuestes Reranker v2 Modell kalibriert ist, während unser früheres jina-embeddings-v2-base-en, das im Oktober 2023 veröffentlicht wurde, dies nicht war, weshalb seine Werte zwischen 0,60 und 0,90 verteilt sind. Allerdings hat dieser zweite Grund nichts mit seiner Annäherung an G(q,d)G(q,d)G(q,d) zu tun; es ist nur so, dass ein gut kalibrierter semantischer Score zwischen 0 und 1 intuitiver zu verstehen und zu vergleichen ist.

tagAbschließende Gedanken

Was ist also die Kernaussage für SEO hier? Wie wirkt sich das auf Ihre SEO-Strategie aus? Ehrlich gesagt, nicht viel.

Die aufwändigen Diagramme oben verdeutlichen ein SEO-Grundprinzip, das Sie wahrscheinlich bereits kennen: Schreiben Sie Inhalte, nach denen Nutzer suchen, und stellen Sie sicher, dass sie mit beliebten Suchanfragen in Beziehung stehen. Wenn Sie einen guten Prädiktor wie Reranker V2 haben, können Sie ihn vielleicht als eine Art "SEO-Copilot" verwenden, um Ihr Schreiben zu lenken.

Oder vielleicht auch nicht. Vielleicht sollten Sie einfach um des Wissens willen schreiben, schreiben, um sich selbst zu verbessern, nicht um Google oder irgendjemanden zu gefallen. Denn wenn Sie denken ohne zu schreiben, denken Sie nur, dass Sie denken.

Kategorien:
Tech-Blog
rss_feed

Weiterlesen
März 11, 2026 • 7 Minuten gelesen
Bootstrapping Audio Embeddings from Multimodal LLMs
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
März 06, 2026 • 6 Minuten gelesen
Identifying Embedding Models from Raw Numerical Values
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
September 09, 2025 • 11 Minuten gelesen
Multimodal Embeddings in Llama.cpp and GGUF
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.