E/A-Diagramm
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
BEIR
63.20
Parameters
597M
Rank by score
1 / 21
Pareto front
On it
Werteverteilunghelp_outlineAUC 0.9596
Korpus
Übersetzungspaare
Dokumentensuche
Code
Verwandt89.1%
Hartes Negativ23.7%
Unverwandt10.9%
Empfohlene Schwellenwerte
FPR 0.1 · 0.107
FPR 0.01 · 0.438
FPR 0.001 · 0.635
FPR 0.0001 · 0.690
ausgewogen · 0.070
AUC
0.9596
Rauschgrenze
0.621
Recall-Kante
-0.039
Gemessene Paare
119 / 2,856
Score nach Ranghelp_outline
Mittlerer Score je Rangposition
Was Rang 1 gewinnthelp_outline
Ein korrekter Treffer gewinnt 66 % von 119 Anfragen
Pool-Empfindlichkeithelp_outline
Position in der Liste0.185
Pool-Größe0.057
Schwierigkeit der Füller0.034
Größter Score-Ausschlag beim selben Paar
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)
Überblick
jina-reranker-v3.5 ist ein mehrsprachiger, listenweiser Dokumenten-Reranker mit 0,6 Milliarden Parametern und ein direktes Upgrade von jina-reranker-v3. Er behält die LBNL-Schnittstelle (Last But Not Late) bei – das Ranking einer Anfrage gegenüber vielen Kandidaten in einem einzigen Vorwärtsdurchlauf – und verbessert gleichzeitig die Domänenrobustheit, das Ranking strukturierter Daten, die mehrsprachige Suche und die Inferenzeffizienz. Basierend auf Qwen3-0.6B mit 28 Schichten und hybrider 3L2G-Attention (Sliding-Window-Schichten, Fenstergröße 1024, verschachtelt mit Global-Attention-Schichten und einer fixierten globalen Terminalschicht gemäß LBNL) sowie einem ressourcenschonenden MLP-Projektor (1024→512→512) unterstützt er bis zu 131.000 Kontext-Token und rankt Dokumente gemeinsam mittels kausaler Selbstaufmerksamkeit und Kosinus-Scoring. Es erreicht 63,20 nDCG-10 auf BEIR – mehr als der 4B Qwen3-Reranker bei etwa 7× weniger Parametern – und ist dabei 1,22×–1,56× schneller als v3 in kurzen bis langen Kontexten.
Methoden
jina-reranker-v3.5 behält das LBNL-Listwise-Design (Last But Not Late) von jina-reranker-v3 bei – Anfrage und Kandidaten teilen sich ein Kontextfenster, und ein Kontext-Embedding wird aus dem letzten Token jedes Dokuments gelesen – ersetzt jedoch die einheitliche globale Aufmerksamkeit durch ein hybrides 3L2G-Schema: Innerhalb jeder Schichtgruppe werden Sliding-Window-Attention-Schichten (Fenstergröße 1024) mit globalen Aufmerksamkeitsschichten verschachtelt, und eine abschließende globale Schicht wird, wie von LBNL gefordert, fixiert. Dies reduziert die Aufmerksamkeitskosten bei langen Kandidatenlisten und erhält gleichzeitig die Interaktion zwischen Dokumenten. Das Modell wird mit Selbstdestillation für domänenrobustes Retrieval trainiert, und sein MLP-Projektorkopf gibt 512-dimensionale Embeddings (1024→512→512) aus.
Leistung
Unter Anwendung eines einheitlichen Top-100-Protokolls mit jina-embeddings-v5-text-small als erster Stufe erzielt jina-reranker-v3.5 folgende Werte: 63,20 nDCG-10 bei BEIR, 74,11 bei MIRACL, 70,95 bei RTEB und 48,3 bei Struct-IR. Damit verbessert sich jina-reranker-v3.5 in allen Bereichen gegenüber jina-reranker-v3 (62,10 / 72,20 / 68,01 / 38,7). Der BEIR-Wert übertrifft den des 4B Qwen3-Rerankers (62,28) bei etwa siebenmal weniger Parametern und führt das Feld aller evaluierten Reranker der 0,6B-Klasse an. Die relativen Verbesserungen gegenüber v3 umfassen +1,10 BEIR, +2,6 % MIRACL, +4,3 % RTEB (mit deutlichen Verbesserungen bei der juristischen Suche) und +24,8 % beim Ranking strukturierter Daten (Struct-IR). Die listenweise Inferenz ist von kurzen zu langen Kontexten 1,22×–1,56× schneller als v3 (A100, FlashAttention-2).
Anleitung
jina-reranker-v3.5 ist ein direkter Ersatz für jina-reranker-v3: Das Anfrageschema bleibt unverändert, daher genügt es, die Modellzeichenfolge von jina-reranker-v3 auf jina-reranker-v3.5 umzustellen. Das Modell vergleicht eine Anfrage mit der gesamten Kandidatenliste in einem einzigen Aufruf. Dokumente werden über den Standard-Rerank-Endpunkt übergeben. Mit `top_n` lassen sich die zurückgegebenen Ergebnisse einschränken, oder `return_embeddings` kann aktiviert werden, um auch Dokumenteneinbettungen abzurufen. Das Modell eignet sich besonders gut für das Ranking strukturierter Daten, die Suche nach juristischen und anderen domänenspezifischen Informationen sowie für mehrsprachige Sammlungen. Dank seines Hybrid-Attention-Designs bleibt die Latenz auch bei langen Kandidatenlisten gering. Verfügbar unter CC-BY-NC-4.0 auf Hugging Face; für die kommerzielle Nutzung kontaktieren Sie uns bitte.
Blogs, die dieses Modell erwähnen



