Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Modellarchitektur
Erste Schritte
Fazit
star
Hervorgehoben
Pressemitteilung
Oktober 03, 2025

Jina Reranker v3: 0.6B Listwise Reranker für SOTA Multilingual Retrieval

Ein neuer Listwise-Reranker mit 0,6 Milliarden Parametern, der die Anfrage und alle Kandidatendokumente in einem einzigen Kontextfenster berücksichtigt.
Jina AI • 7 Minuten gelesen
jinaai/jina-reranker-v3 · Hugging Face
We’re on a journey to advance and democratize artificial intelligence through open source and open science.
jina-reranker-v3: Last but Not Late Interaction for Document Reranking
jina-reranker-v3 is a 0.6B parameter multilingual document reranker that introduces a novel last but not late interaction. Unlike late interaction models such as ColBERT that perform separate encoding followed by multi-vector matching, our approach conducts causal self-attention between query and documents within the same context window, enabling rich cross-document interactions before extracting contextual embeddings from the last token of each document. This compact architecture achieves state-of-the-art BEIR performance with 61.94 nDCG@10 while being ten times smaller than generative listwise rerankers.
arXiv.orgFeng Wang

Wir freuen uns, jina-reranker-v3 zu veröffentlichen, unseren Reranker der neuesten Generation, der in mehrsprachigen Retrieval-Benchmarks eine erstklassige Leistung erbringt. Dieser Dokument-Reranker mit 0,6 Milliarden Parametern führt eine neuartige "Last but not Late"-Interaktion ein, die sich grundlegend von bestehenden Methoden unterscheidet. jina-reranker-v3 arbeitet listwise: Er wendet kausale Aufmerksamkeit zwischen der Abfrage und allen Kandidatendokumenten innerhalb eines einzigen Kontextfensters an, wodurch umfangreiche dokumentübergreifende Interaktionen ermöglicht werden, bevor kontextbezogene Vektorräume aus dem letzten Token jedes Dokuments extrahiert werden. Unser neues Modell erreicht 61,94 nDCG@10 auf BEIR und übertrifft Qwen3-Reranker-4B, während es 6× kleiner ist.

Model Größe BEIR MIRACL MKQA CoIR
jina-reranker-v3 0.6B 61.94 66.83 67.92 70.64
jina-reranker-v2 0.3B 57.06 63.65 67.90 56.14
jina-reranker-m0 2.4B 58.95 66.75 68.19 63.55
bge-reranker-v2-m3 0.6B 56.51 69.32 67.88 36.28
mxbai-rerank-base-v2 0.5B 58.40 55.32 64.24 65.71
mxbai-rerank-large-v2 1.5B 61.44 57.94 67.06 70.87
Qwen3-Reranker-0.6B 0.6B 56.28 57.70 65.34 65.18
Qwen3-Reranker-4B 4.0B 61.16 67.52 67.52 73.91
jina-code-embeddings-0.5b 0.5B - - - 73.94
Englische Retrieval-Performance auf BEIR, gemessen mit nDCG@10. Alle Ergebnisse sind unsere Läufe basierend auf den Top-100-Ergebnissen von jina-embeddings-v3 als erste Stufe des Retrievers. Wir evaluieren drei Varianten von jina-reranker-v3: Dokumente, die nach absteigenden Relevanzwerten, aufsteigenden Werten und zufälliger Permutation geordnet sind. Die Auswertung zeigt, dass v3 eine relativ stabile Leistung über verschiedene Eingabeordnungen hinweg beibehält, was auf robuste Selbstaufmerksamkeitsmechanismen hindeutet, die Dokumente unabhängig von ihrer anfänglichen Anordnung effektiv verarbeiten können.
Die MIRACL-Evaluation über 18 verschiedene Sprachen hinweg demonstriert die sprachübergreifende Konsistenz von jina-reranker-v3 trotz seiner kompakten Architektur. Die von uns evaluierten Sprachen umfassen Englisch, Chinesisch, Spanisch, Arabisch, Französisch, Russisch, Deutsch, Japanisch, Indonesisch, Hindi, Bengalisch, Koreanisch, Suaheli, Telugu, Thailändisch, Persisch/Farsi, Yoruba und Finnisch.
Mehrsprachige Retrieval-Performance auf dem MKQA, gemessen mit Recall@10. Die von uns evaluierten Sprachen umfassen Englisch, Chinesisch (vereinfacht), Spanisch, Arabisch, Portugiesisch, Russisch, Japanisch, Deutsch, Französisch, Koreanisch, Vietnamesisch, Italienisch, Türkisch, Polnisch, Thailändisch, Niederländisch, Malaiisch, Chinesisch (traditionell), Schwedisch, Hebräisch, Ungarisch, Chinesisch (Hongkong), Dänisch, Norwegisch, Finnisch und Khmer.

tagModellarchitektur

jina-reranker-v3 basiert auf dem Qwen3-0.6B-Backbone, einem reinen Decoder-Transformer-Modell mit kausaler Selbstaufmerksamkeit. Das Modell verarbeitet mehrere Dokumente und Abfragen gleichzeitig und extrahiert kontextbezogene Vektorräume an bestimmten Token-Positionen für eine effiziente Ähnlichkeitsberechnung.

Architektur von jina-reranker-v3, die den Transformer-Backbone mit speziellen Token-Positionen für die Extraktion von Vektorräumen zeigt. Das Modell verarbeitet mehrere Dokumente und Abfragen in einem Kontextfenster und extrahiert kontextbezogene Vektorräume an bestimmten Token-Positionen für die Ähnlichkeitsberechnung.
Parameter Wert
Gesamtparameter 0.6B
Nicht-Embedding-Parameter 0.44B
Verborgene Größe 1,024
Anzahl der Schichten 28
Aufmerksamkeitsköpfe (Q/KV) 16/8 (GQA)
Kontextlänge 131,072
MLP-Projektor 1024→512→256
Endgültige Embedding-Größe 256

Angesichts einer Abfrage und einer Reihe von Kandidatendokumenten verarbeitet jina-reranker-v3 die Reranking-Aufgabe mit einer speziellen Prompt-Vorlage, die dokumentübergreifende Interaktionen innerhalb eines einzigen Vorwärtsdurchlaufs ermöglicht. Die Eingabekonstruktion folgt einem bestimmten Format:

<|im_start|>system
You are a search relevance expert who can determine
a ranking of passages based on their relevance to the query.
<|im_end|>

<|im_start|>user
I will provide you with k passages, each indicated by a numerical identifier.
Rank the passages based on their relevance to query: [QUERY]

<passage id="1">
[DOCUMENT_1]<|doc_emb|>
</passage>
<passage id="2">
[DOCUMENT_2]<|doc_emb|>
</passage>
...
<passage id="k">
[DOCUMENT_k]<|doc_emb|>
</passage>

<query>
[QUERY]<|query_emb|>
</query>
<|im_end|>

<|im_start|>assistant
<think></think>

Jedes Dokument wird in Passage-Tags mit fortlaufenden IDs eingeschlossen, wodurch innerhalb des gemeinsamen Kontextfensters klare Dokumentgrenzen ermöglicht werden. Das Modell verarbeitet bis zu 64 Dokumente gleichzeitig innerhalb seiner 131K-Token-Kontextkapazität. Bei größeren Dokumentensammlungen erfolgt die Verarbeitung in Batches, wobei die Abfragekonsistenz über die Batches hinweg erhalten bleibt.

Die Abfrage erscheint zweimal in der Eingabestruktur – einmal am Anfang für Aufgabenanweisungen und einmal am Ende für die endgültige Aufmerksamkeitsverarbeitung. Diese doppelte Platzierung ermöglicht es der endgültigen Abfrageposition, durch kausale Aufmerksamkeit alle vorangegangenen Dokumente zu berücksichtigen. Zwei wichtige spezielle Token markieren die Positionen für die Extraktion von Vektorräumen: Das <|doc_emb|>-Token wird nach jedem Dokument platziert, um die Punkte für die Extraktion von Dokumentenvektorräumen zu markieren, während das <|query_emb|>-Token nach der endgültigen Abfrage platziert wird, um den Punkt für die Extraktion von Abfragevektorräumen zu markieren. Diese Vektorräume erfassen sowohl die lokale Dokumentsemantik als auch den globalen dokumentübergreifenden Kontext durch den gemeinsamen Mechanismus der kausalen Selbstaufmerksamkeit.

Wir nennen diese Abfrage-Dokument-Interaktion "Last but not Late" (Letzte, aber nicht späte Interaktion). Sie ist "last", weil <|doc_emb|> als letztes Token jedes Dokuments platziert wird. Sie ist "not late", weil wir, im Gegensatz zu späten Interaktionsmodellen wie ColBERT, die Dokumente vor dem Multi-Vektor-Matching separat kodieren, Abfrage-Dokument- und Dokument-Dokument-Interaktionen innerhalb desselben Kontextfensters während des Vorwärtsdurchlaufs ermöglichen.

Schließlich bildet ein zweischichtiges MLP-Projektor mit ReLU-Aktivierung die 1024-dimensionalen verborgenen Zustände auf einen 256-dimensionalen Ranking-Raum ab. Die Relevanzbewertung wird mithilfe der Kosinusähnlichkeit zwischen dem projizierten Abfrage-Vektor und jedem projizierten Dokument-Vektor berechnet. Dies ergibt eine Relevanzbewertung für jedes Dokument im Eingabesatz.

tagErste Schritte

tagÜber die API

Der einfachste Weg, jina-reranker-v3 zu verwenden, ist über unsere Search Foundation API.

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer JINA_API_KEY" \
  -d '{
  "model": "jina-reranker-v3",
  "query": "slm markdown",
  "documents": [
    ...
  ],
  "return_documents": false
}'
{
  "model":"jina-reranker-v3",
  "usage": {
    "total_tokens":2813
  },
  "results":[
    {
      "index":1,
      "relevance_score":0.9310624287463884
    },
    {
      "index":4,
      "relevance_score":0.8982678574191957
    },
    {
      "index":0,
      "relevance_score":0.890233167219021
    },
    ...
  ]
}

Das Feld relevance_score gibt die Relevanz jedes Dokuments für die Abfrage an, wobei höhere Werte eine größere Relevanz bedeuten.

tagVia transformers

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

Jetzt können Sie die rerank-Funktion des Modells verwenden, um Relevanzbewertungen für eine Abfrage und eine Liste von Dokumenten zu berechnen:

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains antioxidants called catechins that may help reduce inflammation and protect cells from damage.",
    "El precio del café ha aumentado un 20% este año debido a problemas en la cadena de suministro.",
    "Studies show that drinking green tea regularly can improve brain function and boost metabolism.",
    "Basketball is one of the most popular sports in the United States.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险,还有助于控制体重。",
    "Le thé vert est riche en antioxydants et peut améliorer la fonction cérébrale.",
]

# Rerank documents
results = model.rerank(query, documents)

# Results are sorted by relevance score (highest first)
for result in results:
    print(f"Score: {result['relevance_score']:.4f}")
    print(f"Document: {result['document'][:100]}...")
    print()

tagFazit

jina-reranker-v3 ist ein neuer multilingualer Listwise-重排器 mit 0,6 Milliarden Parametern, der die Interaktion last but not late für ein effizientes Neuordnen von Dokumenten einführt. Dokumente können sich während der Kodierung gegenseitig beachten, wodurch eine Interaktion entsteht, die das endgültige Ranking beeinflusst.

Eines der Hauptanliegen ist, ob eine solche Interaktion gegenüber Eingabepermutationen resistent ist – das heißt, ob die Rangfolge gleich bleibt, wenn wir die Eingabereihenfolge mischen. Wir haben dies mit einer Abfrage gegen 110 Kandidatendokumente unter Verwendung einer zufälligen Permutation getestet und die Varianz an jeder Rangposition in der folgenden Abbildung dargestellt.

Das Diagramm zur Rangstabilität visualisiert, wie konsistent Dokumente über 1.000 zufällige Eingabepermutationen hinweg an bestimmten Rangpositionen erscheinen. Die y-Achse stellt die Stabilitätsvarianz als Prozentsatz dar, wobei 0 % perfekte Stabilität anzeigt (das exakt gleiche Dokument erscheint immer an diesem Rang) und 100 % maximale Varianz anzeigt (fast alle Dokumente erschienen über Permutationen hinweg an diesem Rang). Die x-Achse zeigt Rangpositionen von 1 bis 110.

Die entscheidende Erkenntnis ist, dass die am höchsten bewerteten Positionen eine ausgezeichnete Stabilität aufweisen. Die Ränge 1-10 weisen eine minimale Varianz auf, wobei die relevantesten Dokumente unabhängig von der Eingabereihenfolge immer ganz oben rangieren. Dies ist entscheidend für nDCG@10 und ähnliche Top-k-Metriken. Irrelevante Dokumente bleiben konstant am Ende, wodurch eine klare Trennung zwischen relevanten und irrelevanten Inhalten entsteht.

Der mittlere Abschnitt zeigt einen signifikanten Positionswechsel, was erwartet und akzeptabel ist. Das Modell verwendet kausale Selbstaufmerksamkeit und kodiert unterschiedliche Kontextinformationen basierend darauf, was in der Sequenz vor ihnen erscheint.

In der Praxis, wo wir uns um die obersten Ergebnisse kümmern, ist ein solches Verhalten vollkommen akzeptabel. Unsere Auswertung zeigt, dass jina-reranker-v3 unsere früheren Generationen, einschließlich jina-reranker-v2-base-multilingual und jina-colbert-v2, sowie viel größere Alternativen wie Qwen3-Reranker-4B und jina-reranker-m0 übertrifft, was dies weiter bestätigt.

Kategorien:
star
Hervorgehoben
Pressemitteilung
rss_feed

Weiterlesen
August 03, 2026 • 11 Minuten gelesen
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
Mai 12, 2026 • 7 Minuten gelesen
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
Februar 19, 2026 • 7 Minuten gelesen
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.