Überblick
jina-reranker-v1-turbo-en ist ein englisches Cross-Encoder-Reranker-Modell mit 37,8M Parametern, das 95 % der Genauigkeit des Basis-Modells liefert, während es Dokumente dreimal schneller verarbeitet und 75 % weniger Speicher verwendet. Es wurde für Produktionssuchsysteme konzipiert, in denen die Qualitäts-Latenz-Abwägung ganzer Cross-Encoder unpraktikabel war, und bietet einen praxistauglichen Weg zur Suchverfeinerung im großen Maßstab.
Methoden
Das Modell komprimiert die 12-Schicht-BERT-Architektur des Basis-Rerankers in ein Sechs-Schicht-Design mit 37,8M Parametern (gegenüber 137M für Basis). Es behält den zentralen BERT-basierten Cross-Attention-Mechanismus für Token-Level-Interaktionen zwischen Query und Dokument bei, optimiert aber für Geschwindigkeit durch reduzierte Schichtzahl und effiziente Parameterallokation. Das Training nutzt Wissens-Destillation: Das größere Basis-Modell agiert als Lehrer und führt die Turbo-Variante an, sodass sie sein Ranking-Verhalten mit weniger Parametern nachbildet. Das Modell unterstützt Sequenzen bis zu 8.192 Tokens über ALiBi-Position-Encodings und ermöglicht umfassende Dokumentenanalyse bei aufrechterhaltener schneller Inferenz.
Leistung
Auf BEIR erreicht die Turbo-Variante einen NDCG@10 von 49,60 und behält 95 % der Performance des Basis-Modells (52,45) bei, während sie bge-reranker-base (47,89, 278M Parameter) übertrifft. In RAG-Anwendungen hält sie eine 83,51 % Trefferquote und 0,6498 MRR. Der Geschwindigkeitsvorteil ist erheblich: dreimal schneller als das Basis-Modell, mit Durchsatz, der nahezu linear mit der reduzierten Parameterzahl skaliert. Die Speicheranforderungen sinken von 550MB (Basis) auf 150MB (Turbo), was Deployment auf kleineren Instanzen und erhebliche Kosteneinsparungen in Cloud-Umgebungen ermöglicht. Die Performance-Beeinträchtigung ist auf den meisten Aufgaben minimal, mit leicht niedrigeren Scores in extrem nuancierten Ranking-Szenarien.
Anleitung
Implementieren Sie eine zweistufige Pipeline: Vektorsuche liefert die initialen Kandidaten, dann rangiert dieses Modell die Top 100–200 neu. Der Sweet Spot für die meisten Anwendungen ist das Re-Ranking von 100–200 Kandidaten pro Query, was Qualität und Geschwindigkeit ausbalanciert. Das Modell ist nur englisch — für mehrsprachige Anwendungen nutzen Sie jina-reranker-v2-base-multilingual oder jina-reranker-v3.5. Es erfordert CUDA-fähige Hardware, läuft aber auf kleineren Instanzen als das Basis-Modell (150MB gegenüber 550MB GPU-Speicher). Verfügbar über Jina-Reranker-API und AWS SageMaker. Für neue Projekte ist jina-reranker-v3.5 (mehrsprachig, listweise, 131K-Kontext) die empfohlene Wahl. Wenn Latenz die primäre Einschränkung ist, macht der 3×-Geschwindigkeitsvorteil dieses Modells es für Echtzeit-Suchanwendungen geeignet.





