

Heute veröffentlichen wir jina-reranker-v3.5, einen Listwise-Reorderer mit 0,6 Mrd. Parametern, der die Last-but-not-late-Interaktion von jina-reranker-v3 beibehält und ihn schneller und weitaus leistungsfähiger bei den Daten macht, die Unternehmen tatsächlich durchsuchen. Er erreicht 63,20 nDCG@10 auf BEIR, liegt damit vor Qwen3-Reranker-4B bei etwa 7-mal weniger Parametern und führt das Reranking bei langen Dokumenten bis zu 1,56-mal schneller durch als v3. Der größte Sprung gelingt beim semistrukturierten Retrieval: +9,6 nDCG@10 gegenüber v3 bei feldbeschränkten Datensätzen.
Drei Änderungen haben dies ermöglicht. Ein hybrider Aufmerksamkeitszeitplan, der die meisten globalen Layer durch Sliding Windows ersetzt und gleichzeitig die letzte Schicht global belässt. Eine Trainingsmischung, die aus den Fehlermodi der Bereiche Recht, Medizin, Finanzen, Mehrsprachigkeit und strukturiertes Retrieval kuratiert wurde. Und ein dreistufiges Selbst-Destillationsrezept, bei dem Lehrer und Schüler die gleiche Größe haben und sich nur im Aufmerksamkeitsmuster unterscheiden.
Qualität im Verhältnis zur Parameteranzahl in den vier Benchmark-Regimes. jina-reranker-v3.5 liegt in allen vier Fällen auf der Pareto-Front: Kein von uns evaluiertes Modell ist gleichzeitig kleiner und besser.

mxbai-rerank-large-v2 bei 62,45 und dem 4-Mrd.-Modell Qwen3-Reranker-4B bei 62,28. Kein größeres Modell, das wir evaluiert haben, bietet eine bessere BEIR-Qualität.
Qwen3-Reranker-4B die 4-Mrd.-Ecke bei 76,56 hält. Die größten sprachenspezifischen Zuwächse gegenüber jina-reranker-v3 zeigen sich bei Yoruba (+4,4), Farsi (+3,1) und Französisch (+3,0).
Qwen3-Reranker-0.6B bei 68,41 als auch das 1,5-Mrd.-Modell mxbai-rerank-large-v2 bei 70,81, während es mit 0,6 Mrd. Parametern läuft. Der verbleibende Abstand zum Qwen3-Reranker-4B bei 77,68 konzentriert sich auf eine Handvoll juristischer und medizinischer Aufgaben.
tagArchitektur
Listwise-Reordering bewertet jeden Kandidaten in einem einzigen Forward-Pass, sodass die vollständige Self-Attention über eine Liste von 100 Dokumenten quadratisch wächst und den KV-Cache aufbläht. Die offensichtliche Lösung ist Sliding-Window-Attention. Unter der LBNL-Interaktion zerstört diese Lösung jedoch das Modell.
Bei LBNL bilden die Abfrage und alle Kandidaten eine einzige kausale Sequenz, und das Token der Abfrage-Einbettung (Embeddings) befindet sich am Ende. Es muss bis zum ersten Kandidaten zurückblicken, um eine dokumentübergreifende Repräsentation aufzubauen. Ein begrenztes Fenster unterbricht diese Abhängigkeit. Deshalb legen wir die letzte Schicht stets global fest, sodass Abfrage- und Dokument-Einbettungs-Token den gesamten Kandidatenkontext zum Zeitpunkt der Extraktion beobachten können. Das Ersetzen dieser einen Schicht durch ein Sliding Window verschlechtert das Listwise-Ranking erheblich; nur diese eine Schicht global zu belassen, bewahrt das gemeinsame Encoding ohne einen vollständig globalen Stack.
Für die verbleibenden 27 Schichten haben wir die Zeitpläne 1L1G, 1L2G, 3L2G und 5L1G untersucht. 3L2G hat gewonnen: drei Sliding-Window-Layer, gefolgt von zwei globalen Layern, wiederholt, was 17 lokale und 11 globale Layer mit einem Fenster von 1.024 词元 ergibt. Lokale Layer senken die Aufmerksamkeitskosten von O(L²) auf O(L·w), während globale Layer alle drei Schritte das langreichweitige kandidatenübergreifende Signal bei jeder Tiefe auffrischen. Dichter getaktete Zeitpläne brachten keinen Durchsatzvorteil; der aggressivere 5L1G-Zeitplan schnitt bei komplexen Multi-Dokument-Aufgaben tendenziell schlechter ab.

tagSelbstdestillation über eine Attention-Lücke hinweg
Die hier angewandte Destillation ist ungewöhnlich. Wir verkleinern kein großes Modell in ein kleines. Lehrer und Schüler sind beide 0,6B groß und unterscheiden sich nur im Attention-Muster. Der Lehrer verwendet Full-Attention mit quadratischen Kosten; der Schüler nutzt 3L2G.
Einen Schüler zu zwingen, gleichzeitig die Attention-Masken zu wechseln und die Ausgaben des Lehrers anzupassen, führt dazu, dass er an beidem scheitert. Daher entkoppelt das Rezept diese beiden Belastungen:
- Stufe I — Lehrer mit Full-Attention. Ausgehend vom öffentlichen jina-reranker-v3-Checkpoint trainieren wir einen Lehrer ohne Einschränkungen durch das gleitende Fenster vollständig auf der kompletten v3.5-Mischung nach. Dies legt die Qualitätsobergrenze für dieses Parameterbudget fest.
- Stufe II — Anpassung der spärlichen Attention (Sparse-Attention). Der Schüler initialisiert sich aus den Gewichten von Stufe I und aktiviert 3L2G. Zuerst trainieren wir nur die Attention-Projektionen, während alles andere eingefroren bleibt, um den spärlichen Masken beizubringen, Informationen weiterzuleiten, ohne die unter Full-Attention gelernten Repräsentationen zu stören. Dann heben wir alle Einfrierungen auf, sodass sich der Schüler an die neue Attention-Geometrie anpasst. Der Schüler ist hier bereits einsatzbereit und schneller, aber es bleibt ein beständiger Abstand zum Lehrer bei BEIR, RTEB-legal und MIRACL.
- Stufe III — Lehrergeführte Destillation. Während der Lehrer eingefroren bleibt, richten wir den Schüler gleichzeitig auf vier Ebenen aus: eine listwise-KL-Divergenz über Softmax-normalisierte Score-Verteilungen, ein MSE auf absolute Scores, ein MSE auf die Hidden-States der letzten Schicht und einen Kosinus-Verlust auf projizierte Vektor-Repräsentationen (Embeddings), zuzüglich Ähnlichkeits- und Dispersions-Regularisierern für den Kontext.
Die Reihenfolge ist entscheidend. Stufe II allein hinterlässt eine spürbare Lücke, da der Schüler sein Routing unter einer schwächeren Maske ändern muss, bevor er die Scores und Zustände des Lehrers sicher nachahmen kann. Stufe III schließt den Großteil dieser Lücke, was zeigt, dass die Kapazität der Full-Attention auf einen spärlichen Schüler übertragen werden kann, sobald sich die Geometrie angepasst hat. Das Rezept ist für 3L2G geschrieben, aber der Ablauf lässt sich auf andere Diskrepanzen bei Attention-Zeitplänen verallgemeinern.
tagTrainingsdaten
Die v3-Mischung deckte allgemeines Retrieval gut und spezialisierte Domänen schlecht ab. Anstatt mehr Daten hinzuzufügen, führten wir Fehleranalysen auf den Entwicklungs-Sets von RTEB und STARK durch und erstellten jedes neue Fragment (Shard) so, dass es genau die Retrieval-Muster abdeckt, bei denen allgemeine Modelle scheitern. Harte Negative stammen von mehreren Retrievern gleichzeitig (BM25, Jina, BGE, GTE, E5, ColBERT), damit das Modell nicht die Abkürzungen eines einzelnen Retrievers lernt.
Das juristische Fragment kombiniert EUR-Lex multilingual, CLERC, AILA, kanadische Rechtsprechung, Schweizer Fallzusammenfassungen und EuroVoc. Es wurde überproportional gewichtet, da juristische Texte zitierdicht und lang sind. Das medizinische Fragment zielt auf klinische Ausdrucksweise und entitätenreiche Passagen ab. Das Finanz-Fragment priorisiert numerische Angaben, regulatorische Sprache und tabellenbewusste Passagen. Die mehrsprachige Abdeckung geht über MIRACL und mMARCO hinaus und umfasst WebFAQ in über 50 Sprachen, SWIM-IR-übersprachenübergreifende Negative und japanische Ruri-v3-Paare.
Strukturierte Daten erhielten das höchste Abtastgewicht, da sie außerhalb der Verteilung freier Texte liegen, die von Standard-Benchmarks angenommen werden. Die Relevanz bei Datensätzen und Tabellen hängt von Gleichheit, numerischen und Datumsbereichen, Listenzugehörigkeit und logischen Kombinationen über Felder hinweg ab, nicht von lexikalischer Überschneidung. Frühe Durchläufe schnitten hier am schlechtesten ab, also synthetisierten wir Paare mit starken Einschränkungen direkt.

tagExperimentelle Ergebnisse
Alle Zahlen führen ein Reranking der Top-100-Kandidaten von jina-embeddings-v5-text-small unter einer vereinheitlichten MTEB v2-Pipeline durch, daher können sie leicht von den vom Anbieter gemeldeten Zahlen abweichen. Vollständige Tabellen pro Datensatz und pro Sprache finden Sie in der Arbeit.
| Modell | Parameter | BEIR | MIRACL | RTEB | Struct-IR |
|---|---|---|---|---|---|
| jina-embeddings-v5-text-small (1. Stufe) | 0.5B | 56.26 | 65.15 | 64.60 | – |
| mxbai-rerank-base-v2 | 0.5B | 59.58 | 64.90 | 61.44 | 30.4 |
| Qwen3-Reranker-0.6B | 0.6B | 56.94 | 67.12 | 68.41 | 41.9 |
| mxbai-rerank-large-v2 | 1.5B | 62.45 | 69.65 | 70.81 | 43.0 |
| Qwen3-Reranker-4B | 4.0B | 62.28 | 76.56 | 77.68 | 55.6 |
| jina-reranker-v3 | 0.6B | 62.10 | 72.20 | 68.01 | 38.7 |
| <strong>jina-reranker-v3.5</strong> | 0.6B | 63.20 | 74.11 | 70.95 | 48.3 |
v3.5 verbessert v3 über jede Benchmark-Familie hinweg bei gleicher Parameteranzahl, mit dem größten Zuwachs beim semistrukturierten Retrieval.
Die Zuwächse bei RTEB konzentrieren sich auf die Bereiche, auf die die Mischung abzielte: AILA-Statute verbessert sich um 14,0 Punkte und AILA-Case um 11,7 gegenüber v3, und FinQA erreicht 86,91, das beste Ergebnis aller getesteten Modelle. Bei STARK verbessert sich v3.5 gegenüber v3 in allen drei offiziellen Metriken und erzielt insgesamt den besten Hit@5.
Ein Protokollhinweis zu Struct-IR. Der Benchmark indiziert Millionen von Objekten pro Schema und der Recall@5 des ersten Retrievals innerhalb des Schemas liegt bei etwa 0,04. Daher ist das End-to-End-Retrieval-dann-Reranking fast vollständig durch den Recall begrenzt und unterscheidet Reranker schlecht. Stattdessen fügen wir alle Gold-Dokumente zusammen mit den 30 härtesten Distraktoren der ersten Stufe ein, was die feldgebundene Diskriminierung von der Retrieval-Abdeckung isoliert. Zahlen unter diesem Pool sind nicht mit der SSRB-Retrieval-Bestenliste vergleichbar.
tagEffizienz
Gemessen auf einer einzelnen NVIDIA A100, Batch-Größe 1, Top-100-Listwise-Eingaben, FlashAttention-2.


Da das produktive Listwise-Reranking von einem einzigen Prefill über eine frische Kandidatenmenge dominiert wird, führen diese Reduzierungen direkt zu längeren Kandidatenlisten und größeren Dokumenten bei einem festen Bereitstellungsbudget.
tagErste Schritte
tagÜber die Jina Search Foundation API
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-reranker-v3.5",
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"documents": [
"...",
"..."
],
"return_documents": false
}'tagÜber den Elastic Inference Service
jina-reranker-v3.5 ist ab Stack 9.3 über den Elastic Inference Service (EIS) verfügbar, sodass Sie Reranking auf verwalteten GPUs durchführen können, ohne das Modell selbst hosten zu müssen. Erstellen Sie einen Inference-Endpunkt, der auf das Modell verweist, und rufen Sie ihn dann wie jede andere rerank-Aufgabe auf.
PUT _inference/rerank/eis-jina-reranker-v3-5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-reranker-v3.5"
}
}POST _inference/rerank/eis-jina-reranker-v3-5
{
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"input": [
"...",
"..."
]
}Die Antwort gibt ein rerank-Array zurück, das nach Relevanz sortiert ist, wobei jeder Eintrag den ursprünglichen Index des Kandidaten und dessen Score enthält. Da es sich um einen Standard-Inference-Endpunkt handelt, kann die inference_id in einer Suchanfrage direkt von einem text_similarity_reranker-Retriever referenziert werden.
tagÜber Transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3.5',
dtype="auto",
trust_remote_code=True,
)
model.eval()
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains catechins that may help reduce inflammation.",
"El precio del cafe ha aumentado un 20% este ano.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
"Le the vert est riche en antioxydants.",
]
for r in model.rerank(query, documents):
print(f"{r['relevance_score']:.4f} {r['document'][:70]}")tagFazit
Der praktische Anspruch von jina-reranker-v3.5 ist präzise und überprüfbar: Mit 0,6B Parametern schließt ein gezieltes Training den Großteil der Lücke zu einem 4B-Generalisten-Re-Ranker; auf BEIR wird diese sogar vollständig geschlossen, während das Modell gleichzeitig schneller läuft als das Modell, das es ersetzt. Für den Einsatz in Unternehmen spricht dies dafür, eher in eine fokussierte Überwachung auf einem kompakten Backbone zu investieren, anstatt standardmäßig auf das größte verfügbare Modell zurückzugreifen.
Zwei Einschränkungen sollten klar benannt werden. Listwise-Re-Ranker unterliegen nach wie vor Eingabebeschränkungen, die Pointwise- und Late-Interaction-Modelle vermeiden, insbesondere durch feste Obergrenzen für die Anzahl der Kandidaten und die Gesamtlänge der Kandidaten. Zudem bleiben wichtige Lücken zum 4B-Qwen-Modell bei juristischen und medizinischen Aufgaben im Rahmen von RTEB, bei Struct-IR mit kontrolliertem Pool sowie bei ressourcenarmen MIRACL-Sprachen bestehen. Dies sind die schwierigen Fälle, und wir benennen sie, anstatt sie hinter einem Durchschnittswert zu verbergen.






