E/A-Diagramm

mehrere

Dokument

Abfrage

jina-reranker-v1

Ranking

Pareto-Front
30M100M300M0.810.820.830.84bge-reranker-basejina-reranker-v1-base-enjina-reranker-v1-tiny-enms-marco-MiniLM-L-4-v2ms-marco-MiniLM-L-6-v2mxbai-rerank-base-v1mxbai-rerank-xsmall-v1jina-reranker-v1-turbo-…Parameter (log)hit-rate
Dieses Modell
Auf der Front
Jina AI
Andere
LlamaIndex RAG · avg3emb
0.835
Parameter
38M
Rang nach Score
2 / 8
Pareto-Front
Darauf
Werteverteilung
AUC 0.8287
Korpus
Übersetzungspaare
0.4800.000.200.400.600.80
Verwandt29.0%
Hartes Negativ7.0%
Unverwandt1.1%
Empfohlene Schwellenwerte
FPR 0.1 · 0.223
FPR 0.01 · 0.480
FPR 0.001 · 0.753
FPR 0.0001 · 0.959
ausgewogen · 0.083
AUC
0.8287
Rauschgrenze
0.731
Recall-Kante
0.019
Gemessene Paare
100 / 9.200
Score nach Rang
12345678910
Mittlerer Score je Rangposition
Wählen Sie Modelle zum Vergleichen aus

Überblick

jina-reranker-v1-turbo-en ist ein englisches Cross-Encoder-Reranker-Modell mit 37,8M Parametern, das 95 % der Genauigkeit des Basis-Modells liefert, während es Dokumente dreimal schneller verarbeitet und 75 % weniger Speicher verwendet. Es wurde für Produktionssuchsysteme konzipiert, in denen die Qualitäts-Latenz-Abwägung ganzer Cross-Encoder unpraktikabel war, und bietet einen praxistauglichen Weg zur Suchverfeinerung im großen Maßstab.

Methoden

Das Modell komprimiert die 12-Schicht-BERT-Architektur des Basis-Rerankers in ein Sechs-Schicht-Design mit 37,8M Parametern (gegenüber 137M für Basis). Es behält den zentralen BERT-basierten Cross-Attention-Mechanismus für Token-Level-Interaktionen zwischen Query und Dokument bei, optimiert aber für Geschwindigkeit durch reduzierte Schichtzahl und effiziente Parameterallokation. Das Training nutzt Wissens-Destillation: Das größere Basis-Modell agiert als Lehrer und führt die Turbo-Variante an, sodass sie sein Ranking-Verhalten mit weniger Parametern nachbildet. Das Modell unterstützt Sequenzen bis zu 8.192 Tokens über ALiBi-Position-Encodings und ermöglicht umfassende Dokumentenanalyse bei aufrechterhaltener schneller Inferenz.

Leistung

Auf BEIR erreicht die Turbo-Variante einen NDCG{'@'}10 von 49,60 und behält 95 % der Performance des Basis-Modells (52,45) bei, während sie bge-reranker-base (47,89, 278M Parameter) übertrifft. In RAG-Anwendungen hält sie eine 83,51 % Trefferquote und 0,6498 MRR. Der Geschwindigkeitsvorteil ist erheblich: dreimal schneller als das Basis-Modell, mit Durchsatz, der nahezu linear mit der reduzierten Parameterzahl skaliert. Die Speicheranforderungen sinken von 550MB (Basis) auf 150MB (Turbo), was Deployment auf kleineren Instanzen und erhebliche Kosteneinsparungen in Cloud-Umgebungen ermöglicht. Die Performance-Beeinträchtigung ist auf den meisten Aufgaben minimal, mit leicht niedrigeren Scores in extrem nuancierten Ranking-Szenarien.

Anleitung

Implementieren Sie eine zweistufige Pipeline: Vektorsuche liefert die initialen Kandidaten, dann rangiert dieses Modell die Top 100–200 neu. Der Sweet Spot für die meisten Anwendungen ist das Re-Ranking von 100–200 Kandidaten pro Query, was Qualität und Geschwindigkeit ausbalanciert. Das Modell ist nur englisch — für mehrsprachige Anwendungen nutzen Sie jina-reranker-v2-base-multilingual oder jina-reranker-v3.5. Es erfordert CUDA-fähige Hardware, läuft aber auf kleineren Instanzen als das Basis-Modell (150MB gegenüber 550MB GPU-Speicher). Verfügbar über Jina-Reranker-API und AWS SageMaker. Für neue Projekte ist jina-reranker-v3.5 (mehrsprachig, listweise, 131K-Kontext) die empfohlene Wahl. Wenn Latenz die primäre Einschränkung ist, macht der 3×-Geschwindigkeitsvorteil dieses Modells es für Echtzeit-Suchanwendungen geeignet.

Blogs, die dieses Modell erwähnen