Wir freuen uns, jina-reranker-v3 zu veröffentlichen, unseren Reranker der neuesten Generation, der in mehrsprachigen Retrieval-Benchmarks eine erstklassige Leistung erbringt. Dieser Dokument-Reranker mit 0,6 Milliarden Parametern führt eine neuartige "Last but not Late"-Interaktion ein, die sich grundlegend von bestehenden Methoden unterscheidet. jina-reranker-v3 arbeitet listwise: Er wendet kausale Aufmerksamkeit zwischen der Abfrage und allen Kandidatendokumenten innerhalb eines einzigen Kontextfensters an, wodurch umfangreiche dokumentübergreifende Interaktionen ermöglicht werden, bevor kontextbezogene Vektorräume aus dem letzten Token jedes Dokuments extrahiert werden. Unser neues Modell erreicht 61,94 nDCG@10 auf BEIR und übertrifft Qwen3-Reranker-4B, während es 6× kleiner ist.
| Model | Größe | BEIR | MIRACL | MKQA | CoIR |
|---|---|---|---|---|---|
| jina-reranker-v3 | 0.6B | 61.94 | 66.83 | 67.92 | 70.64 |
| jina-reranker-v2 | 0.3B | 57.06 | 63.65 | 67.90 | 56.14 |
| jina-reranker-m0 | 2.4B | 58.95 | 66.75 | 68.19 | 63.55 |
| bge-reranker-v2-m3 | 0.6B | 56.51 | 69.32 | 67.88 | 36.28 |
| mxbai-rerank-base-v2 | 0.5B | 58.40 | 55.32 | 64.24 | 65.71 |
| mxbai-rerank-large-v2 | 1.5B | 61.44 | 57.94 | 67.06 | 70.87 |
| Qwen3-Reranker-0.6B | 0.6B | 56.28 | 57.70 | 65.34 | 65.18 |
| Qwen3-Reranker-4B | 4.0B | 61.16 | 67.52 | 67.52 | 73.91 |
| jina-code-embeddings-0.5b | 0.5B | - | - | - | 73.94 |



tagModellarchitektur
jina-reranker-v3 basiert auf dem Qwen3-0.6B-Backbone, einem reinen Decoder-Transformer-Modell mit kausaler Selbstaufmerksamkeit. Das Modell verarbeitet mehrere Dokumente und Abfragen gleichzeitig und extrahiert kontextbezogene Vektorräume an bestimmten Token-Positionen für eine effiziente Ähnlichkeitsberechnung.
| Parameter | Wert |
|---|---|
| Gesamtparameter | 0.6B |
| Nicht-Embedding-Parameter | 0.44B |
| Verborgene Größe | 1,024 |
| Anzahl der Schichten | 28 |
| Aufmerksamkeitsköpfe (Q/KV) | 16/8 (GQA) |
| Kontextlänge | 131,072 |
| MLP-Projektor | 1024→512→256 |
| Endgültige Embedding-Größe | 256 |
Angesichts einer Abfrage und einer Reihe von Kandidatendokumenten verarbeitet jina-reranker-v3 die Reranking-Aufgabe mit einer speziellen Prompt-Vorlage, die dokumentübergreifende Interaktionen innerhalb eines einzigen Vorwärtsdurchlaufs ermöglicht. Die Eingabekonstruktion folgt einem bestimmten Format:
<|im_start|>system
You are a search relevance expert who can determine
a ranking of passages based on their relevance to the query.
<|im_end|>
<|im_start|>user
I will provide you with k passages, each indicated by a numerical identifier.
Rank the passages based on their relevance to query: [QUERY]
<passage id="1">
[DOCUMENT_1]<|doc_emb|>
</passage>
<passage id="2">
[DOCUMENT_2]<|doc_emb|>
</passage>
...
<passage id="k">
[DOCUMENT_k]<|doc_emb|>
</passage>
<query>
[QUERY]<|query_emb|>
</query>
<|im_end|>
<|im_start|>assistant
<think></think>Jedes Dokument wird in Passage-Tags mit fortlaufenden IDs eingeschlossen, wodurch innerhalb des gemeinsamen Kontextfensters klare Dokumentgrenzen ermöglicht werden. Das Modell verarbeitet bis zu 64 Dokumente gleichzeitig innerhalb seiner 131K-Token-Kontextkapazität. Bei größeren Dokumentensammlungen erfolgt die Verarbeitung in Batches, wobei die Abfragekonsistenz über die Batches hinweg erhalten bleibt.
Die Abfrage erscheint zweimal in der Eingabestruktur – einmal am Anfang für Aufgabenanweisungen und einmal am Ende für die endgültige Aufmerksamkeitsverarbeitung. Diese doppelte Platzierung ermöglicht es der endgültigen Abfrageposition, durch kausale Aufmerksamkeit alle vorangegangenen Dokumente zu berücksichtigen. Zwei wichtige spezielle Token markieren die Positionen für die Extraktion von Vektorräumen: Das <|doc_emb|>-Token wird nach jedem Dokument platziert, um die Punkte für die Extraktion von Dokumentenvektorräumen zu markieren, während das <|query_emb|>-Token nach der endgültigen Abfrage platziert wird, um den Punkt für die Extraktion von Abfragevektorräumen zu markieren. Diese Vektorräume erfassen sowohl die lokale Dokumentsemantik als auch den globalen dokumentübergreifenden Kontext durch den gemeinsamen Mechanismus der kausalen Selbstaufmerksamkeit.
Wir nennen diese Abfrage-Dokument-Interaktion "Last but not Late" (Letzte, aber nicht späte Interaktion). Sie ist "last", weil <|doc_emb|> als letztes Token jedes Dokuments platziert wird. Sie ist "not late", weil wir, im Gegensatz zu späten Interaktionsmodellen wie ColBERT, die Dokumente vor dem Multi-Vektor-Matching separat kodieren, Abfrage-Dokument- und Dokument-Dokument-Interaktionen innerhalb desselben Kontextfensters während des Vorwärtsdurchlaufs ermöglichen.
Schließlich bildet ein zweischichtiges MLP-Projektor mit ReLU-Aktivierung die 1024-dimensionalen verborgenen Zustände auf einen 256-dimensionalen Ranking-Raum ab. Die Relevanzbewertung wird mithilfe der Kosinusähnlichkeit zwischen dem projizierten Abfrage-Vektor und jedem projizierten Dokument-Vektor berechnet. Dies ergibt eine Relevanzbewertung für jedes Dokument im Eingabesatz.
tagErste Schritte
tagÜber die API
Der einfachste Weg, jina-reranker-v3 zu verwenden, ist über unsere Search Foundation API.
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer JINA_API_KEY" \
-d '{
"model": "jina-reranker-v3",
"query": "slm markdown",
"documents": [
...
],
"return_documents": false
}'{
"model":"jina-reranker-v3",
"usage": {
"total_tokens":2813
},
"results":[
{
"index":1,
"relevance_score":0.9310624287463884
},
{
"index":4,
"relevance_score":0.8982678574191957
},
{
"index":0,
"relevance_score":0.890233167219021
},
...
]
}Das Feld relevance_score gibt die Relevanz jedes Dokuments für die Abfrage an, wobei höhere Werte eine größere Relevanz bedeuten.
tagVia transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3',
dtype="auto",
trust_remote_code=True,
)
model.eval()Jetzt können Sie die rerank-Funktion des Modells verwenden, um Relevanzbewertungen für eine Abfrage und eine Liste von Dokumenten zu berechnen:
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains antioxidants called catechins that may help reduce inflammation and protect cells from damage.",
"El precio del café ha aumentado un 20% este año debido a problemas en la cadena de suministro.",
"Studies show that drinking green tea regularly can improve brain function and boost metabolism.",
"Basketball is one of the most popular sports in the United States.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险,还有助于控制体重。",
"Le thé vert est riche en antioxydants et peut améliorer la fonction cérébrale.",
]
# Rerank documents
results = model.rerank(query, documents)
# Results are sorted by relevance score (highest first)
for result in results:
print(f"Score: {result['relevance_score']:.4f}")
print(f"Document: {result['document'][:100]}...")
print()
tagFazit
jina-reranker-v3 ist ein neuer multilingualer Listwise-重排器 mit 0,6 Milliarden Parametern, der die Interaktion last but not late für ein effizientes Neuordnen von Dokumenten einführt. Dokumente können sich während der Kodierung gegenseitig beachten, wodurch eine Interaktion entsteht, die das endgültige Ranking beeinflusst.
Eines der Hauptanliegen ist, ob eine solche Interaktion gegenüber Eingabepermutationen resistent ist – das heißt, ob die Rangfolge gleich bleibt, wenn wir die Eingabereihenfolge mischen. Wir haben dies mit einer Abfrage gegen 110 Kandidatendokumente unter Verwendung einer zufälligen Permutation getestet und die Varianz an jeder Rangposition in der folgenden Abbildung dargestellt.

Die entscheidende Erkenntnis ist, dass die am höchsten bewerteten Positionen eine ausgezeichnete Stabilität aufweisen. Die Ränge 1-10 weisen eine minimale Varianz auf, wobei die relevantesten Dokumente unabhängig von der Eingabereihenfolge immer ganz oben rangieren. Dies ist entscheidend für nDCG@10 und ähnliche Top-k-Metriken. Irrelevante Dokumente bleiben konstant am Ende, wodurch eine klare Trennung zwischen relevanten und irrelevanten Inhalten entsteht.
Der mittlere Abschnitt zeigt einen signifikanten Positionswechsel, was erwartet und akzeptabel ist. Das Modell verwendet kausale Selbstaufmerksamkeit und kodiert unterschiedliche Kontextinformationen basierend darauf, was in der Sequenz vor ihnen erscheint.
In der Praxis, wo wir uns um die obersten Ergebnisse kümmern, ist ein solches Verhalten vollkommen akzeptabel. Unsere Auswertung zeigt, dass jina-reranker-v3 unsere früheren Generationen, einschließlich jina-reranker-v2-base-multilingual und jina-colbert-v2, sowie viel größere Alternativen wie Qwen3-Reranker-4B und jina-reranker-m0 übertrifft, was dies weiter bestätigt.








