Überblick
jina-reranker-v3 ist ein 597M-Parameter mehrsprachiger listweiser Reranker, der die 'last but not late' (LBNL)-Interaktion einführt — einen Paradigmenwechsel vom paarweisen Cross-Encoder-Scoring. Statt jedes Query-Dokument-Paar isoliert zu bewerten, verarbeitet es eine gesamte Liste von Kandidatendokumenten gleichzeitig innerhalb eines einzelnen 131K-Token-Kontextfensters und nutzt kausale Aufmerksamkeit, um Dokument-zu-Dokument-Beziehungen zu erfassen. Es erreicht State-of-the-Art-BEIR-Performance (61,94 NDCG@10) mit 2,5× weniger Parametern als der nächstgelegene Wettbewerber.
Methoden
Die Kerninnovation ist die LBNL-Architektur. In einem Standard-Cross-Encoder wird jedes Query-Dokument-Paar unabhängig bewertet. In einem Late-Interaction-Modell (ColBERT) werden Dokumente separat codiert und tokenweise abgeglichen. LBNL kombiniert die Stärken beider: Query und alle Kandidatendokumente teilen einen einzelnen kausalen Aufmerksamkeitskontext, sodass das Modell über Dokumente hinweg Aufmerksamkeit schenken und relative Relevanz-Signale erfassen kann, die paarweises Scoring verfehlt. Das Modell verarbeitet bis zu 16 Dokumente pro Forward-Pass (während des Trainings ein Positives, 15 Negative), wobei jedes Dokument auf eine feste Länge gekürzt wird. Embeddings werden vom finalen Token jedes Dokuments via Last-Token-Pooling extrahiert, was den kausalen Aufmerksamkeitsmechanismus nutzt, um Informationen aus dem vorausgehenden Kontext natürlich zu aggregieren. Das 131K-Token-Kontextfenster wird durch Rotary-Position-Embeddings mit angepassten Basisfrequenzen ermöglicht. Das Training verwendet ein dreistufiges progressives Curriculum mit multi-zielorientiertem Loss, der InfoNCE, Dispersive-Loss (Gewicht 0,45), dual-Matching-Loss (Gewicht 0,85) und Similarity-Loss kombiniert.
Leistung
Auf BEIR erreicht das Modell 61,94 NDCG@10, den höchsten Wert unter allen evaluierten Rerankern und eine Verbesserung von 4,88 % gegenüber jina-reranker-v2. Es ist besonders stark in Multi-Hop-Retrieval (78,56 auf HotpotQA) und Faktenverifizierung (93,95 auf FEVER). Die mehrsprachige Performance erreicht 66,50 auf MIRACL über 18 Sprachen, mit Arabisch bei 78,69 und Thai bei 81,06. Code-Retrieval erreicht 63,28 auf CoIR. Es übertrifft den 1,5B mxbai-rerank-large (61,44) mit 2,5× weniger Parametern und zeigt eine Verbesserung von 5,43 % gegenüber bge-reranker-v2-m3 gleicher Größe. Die Performance ist relativ stabil über Dokumentanordnungen hinweg: zufällig (62,54), absteigend (61,94), aufsteigend (61,52) — was ein robustes listweises Scoring unabhängig von der Kandidatenanordnung anzeigt.
Anleitung
Verwenden Sie die strukturierte Prompt-Vorlage mit System/User/Assistant-Rollen und Sonder-Token für die Embedding-Extraktion. Verarbeiten Sie bis zu 64 Dokumente pro Forward-Pass für Sammlungen, die den 131K-Kontext überschreiten. Optimal bei Dokumenten, die zufällig oder nach absteigender Relevanz geordnet sind (Performance-Unterschied <1 %). Nutzen Sie die Dokument-zu-Dokument-Interaktionsfähigkeit für vergleichende Ranking-Aufgaben — das listweise Design des Modells erfasst Beziehungen zwischen Kandidaten, die paarweises Scoring verfehlt. Für mehrsprachige Anwendungen bietet das Modell starken Zero-Shot-Transfer über 18 Sprachen. Implementieren Sie Batch-Verarbeitung für große Dokumentsets und halten Sie Query-Embeddings konsistent über Batches hinweg. Die 256-dimensionalen Ausgabe-Embeddings unterstützen effiziente Similaritätsberechnung. Ideal für Multi-Hop-Reasoning und Faktenverifizierung. Für Produktion jina-reranker-v3.5 für 1,22–1,56× schnellere Inferenz über Hybrid-Attention verwenden.








