E/A-Diagramm

mehrere

Dokument

Abfrage

jina-reranker-v3

Ranking

Pareto-Front
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-colbert-v2jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-reranker-v3Parameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
MIRACL
72.20
Parameter
597M
Rang nach Score
5 / 17
Pareto-Front
Dahinter
Werteverteilung
AUC 0.8396
Korpus
Übersetzungspaare
Dokumentensuche
Code
0.020-0.200.000.200.400.60
Verwandt62.2%
Hartes Negativ18.2%
Unverwandt9.5%
Empfohlene Schwellenwerte
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
ausgewogen · -0.008
AUC
0.8396
Rauschgrenze
0.414
Recall-Kante
-0.185
Gemessene Paare
119 / 2.856
Score nach Rang
12345678910
Mittlerer Score je Rangposition
Was Rang 1 gewinnt
Ein korrekter Treffer gewinnt 45 % von 119 Anfragen
Pool-Empfindlichkeit
Position in der Liste0.161
Pool-Größe0.088
Schwierigkeit der Füller0.015
Größter Score-Ausschlag beim selben Paar
Wählen Sie Modelle zum Vergleichen aus
Publikationen (1)

Überblick

jina-reranker-v3 ist ein 597M-Parameter mehrsprachiger listweiser Reranker, der die 'last but not late' (LBNL)-Interaktion einführt — einen Paradigmenwechsel vom paarweisen Cross-Encoder-Scoring. Statt jedes Query-Dokument-Paar isoliert zu bewerten, verarbeitet es eine gesamte Liste von Kandidatendokumenten gleichzeitig innerhalb eines einzelnen 131K-Token-Kontextfensters und nutzt kausale Aufmerksamkeit, um Dokument-zu-Dokument-Beziehungen zu erfassen. Es erreicht State-of-the-Art-BEIR-Performance (61,94 NDCG{'@'}10) mit 2,5× weniger Parametern als der nächstgelegene Wettbewerber.

Methoden

Die Kerninnovation ist die LBNL-Architektur. In einem Standard-Cross-Encoder wird jedes Query-Dokument-Paar unabhängig bewertet. In einem Late-Interaction-Modell (ColBERT) werden Dokumente separat codiert und tokenweise abgeglichen. LBNL kombiniert die Stärken beider: Query und alle Kandidatendokumente teilen einen einzelnen kausalen Aufmerksamkeitskontext, sodass das Modell über Dokumente hinweg Aufmerksamkeit schenken und relative Relevanz-Signale erfassen kann, die paarweises Scoring verfehlt. Das Modell verarbeitet bis zu 16 Dokumente pro Forward-Pass (während des Trainings ein Positives, 15 Negative), wobei jedes Dokument auf eine feste Länge gekürzt wird. Embeddings werden vom finalen Token jedes Dokuments via Last-Token-Pooling extrahiert, was den kausalen Aufmerksamkeitsmechanismus nutzt, um Informationen aus dem vorausgehenden Kontext natürlich zu aggregieren. Das 131K-Token-Kontextfenster wird durch Rotary-Position-Embeddings mit angepassten Basisfrequenzen ermöglicht. Das Training verwendet ein dreistufiges progressives Curriculum mit multi-zielorientiertem Loss, der InfoNCE, Dispersive-Loss (Gewicht 0,45), dual-Matching-Loss (Gewicht 0,85) und Similarity-Loss kombiniert.

Leistung

Auf BEIR erreicht das Modell 61,94 NDCG{'@'}10, den höchsten Wert unter allen evaluierten Rerankern und eine Verbesserung von 4,88 % gegenüber jina-reranker-v2. Es ist besonders stark in Multi-Hop-Retrieval (78,56 auf HotpotQA) und Faktenverifizierung (93,95 auf FEVER). Die mehrsprachige Performance erreicht 66,50 auf MIRACL über 18 Sprachen, mit Arabisch bei 78,69 und Thai bei 81,06. Code-Retrieval erreicht 63,28 auf CoIR. Es übertrifft den 1,5B mxbai-rerank-large (61,44) mit 2,5× weniger Parametern und zeigt eine Verbesserung von 5,43 % gegenüber bge-reranker-v2-m3 gleicher Größe. Die Performance ist relativ stabil über Dokumentanordnungen hinweg: zufällig (62,54), absteigend (61,94), aufsteigend (61,52) — was ein robustes listweises Scoring unabhängig von der Kandidatenanordnung anzeigt.

Anleitung

Verwenden Sie die strukturierte Prompt-Vorlage mit System/User/Assistant-Rollen und Sonder-Token für die Embedding-Extraktion. Verarbeiten Sie bis zu 64 Dokumente pro Forward-Pass für Sammlungen, die den 131K-Kontext überschreiten. Optimal bei Dokumenten, die zufällig oder nach absteigender Relevanz geordnet sind (Performance-Unterschied <1 %). Nutzen Sie die Dokument-zu-Dokument-Interaktionsfähigkeit für vergleichende Ranking-Aufgaben — das listweise Design des Modells erfasst Beziehungen zwischen Kandidaten, die paarweises Scoring verfehlt. Für mehrsprachige Anwendungen bietet das Modell starken Zero-Shot-Transfer über 18 Sprachen. Implementieren Sie Batch-Verarbeitung für große Dokumentsets und halten Sie Query-Embeddings konsistent über Batches hinweg. Die 256-dimensionalen Ausgabe-Embeddings unterstützen effiziente Similaritätsberechnung. Ideal für Multi-Hop-Reasoning und Faktenverifizierung. Für Produktion jina-reranker-v3.5 für 1,22–1,56× schnellere Inferenz über Hybrid-Attention verwenden.

Blogs, die dieses Modell erwähnen