Jina AI kündigt neue Modelle in ihrer Familie von hochmodernen Reranker-Modellen an, die jetzt auf AWS Sagemaker und Hugging Face verfügbar sind: jina-reranker-v1-turbo-en und jina-reranker-v1-tiny-en. Diese Modelle priorisieren Geschwindigkeit und Größe bei gleichzeitiger Beibehaltung hoher Leistung in Standard-Benchmarks und bieten einen schnelleren und speichereffizienteren Reranking-Prozess für Umgebungen, in denen Antwortzeit und Ressourcennutzung kritisch sind.



Reranker Turbo und Tiny sind für blitzschnelle Antwortzeiten in Informationsabruf-Anwendungen optimiert. Wie unsere Embedding-Modelle verwenden sie die JinaBERT-Architektur, eine Variante der BERT-Architektur, erweitert um eine symmetrische bidirektionale Variante von ALiBi. Diese Architektur ermöglicht die Unterstützung langer Textsequenzen, wobei unsere Modelle bis zu 8.192 Token verarbeiten können – ideal für die tiefgehende Analyse größerer Dokumente und komplexer Abfragen, die detailliertes Sprachverständnis erfordern.
Die Turbo- und Tiny-Modelle basieren auf Erkenntnissen aus dem Jina Reranker v1. Reranking kann ein großer Engpass für Informationsabruf-Anwendungen sein. Traditionelle Suchanwendungen sind eine sehr ausgereifte Technologie, deren Leistung gut verstanden wird. Reranker fügen der textbasierten Suche eine hohe Präzision hinzu, aber KI-Modelle sind groß und können langsam und teuer in der Ausführung sein.
Viele Benutzer würden ein kleineres, schnelleres, günstigeres Modell bevorzugen, auch wenn dies zu Lasten der Genauigkeit geht. Ein einzelnes Ziel – das Reranking von Suchergebnissen – macht es möglich, das Modell zu optimieren und den Benutzern wettbewerbsfähige Leistung in viel kompakteren Modellen zu bieten. Durch die Verwendung von weniger versteckten Schichten beschleunigen wir die Verarbeitung und reduzieren die Modellgröße. Diese Modelle sind günstiger in der Ausführung, und die höhere Geschwindigkeit macht sie nützlicher für Anwendungen, die keine hohe Latenz tolerieren können, während sie fast die gesamte Leistung größerer Modelle beibehalten.
In diesem Artikel zeigen wir Ihnen die Architektur von Reranker Turbo und Reranker Tiny, messen ihre Leistung und zeigen Ihnen, wie Sie damit beginnen können.
tagOptimierte Architektur
Jina Reranker Turbo (jina-reranker-v1-turbo-en) verwendet eine sechsschichtige Architektur mit insgesamt 37,8 Millionen Parametern, im Gegensatz zu den 137 Millionen Parametern und zwölf Schichten des Basis-Reranker-Modells jina-reranker-v1-base-en. Dies bedeutet eine Reduzierung der Modellgröße um drei Viertel und eine bis zu dreifache Steigerung der Verarbeitungsgeschwindigkeit.
Reranker Tiny (jina-reranker-v1-tiny-en) verwendet vier Schichten mit 33 Millionen Parametern und bietet damit noch höhere parallele Verarbeitung und schnellere Geschwindigkeiten – fast fünfmal so schnell wie das Basis-Reranker-Modell – während 13% der Speicherkosten gegenüber dem Turbo-Modell eingespart werden.

tagKnowledge Distillation
Wir haben Reranker Turbo und Tiny mittels Knowledge Distillation trainiert. Dies ist eine Technik, bei der ein bestehendes KI-Modell verwendet wird, um ein anderes zu trainieren, damit es sein Verhalten nachahmt. Anstatt externe Datenquellen zu verwenden, nutzen wir ein bestehendes Modell zur Generierung von Trainingsdaten. Wir verwendeten das Jina Reranker Base-Modell, um Dokumentensammlungen zu ranken, und nutzten diese Ergebnisse dann zum Training von Turbo und Tiny. Auf diese Weise können wir viel mehr Daten in den Trainingsprozess einbringen, da wir nicht durch verfügbare reale Daten eingeschränkt sind.
Dies ist ein wenig wie ein Schüler, der von einem Lehrer lernt: Das bereits trainierte, leistungsstarke Modell – das Jina Reranker Base-Modell – "lehrt" die untrainierten Jina Turbo- und Jina Tiny-Modelle, indem es neue Trainingsdaten generiert. Diese Technik wird häufig verwendet, um kleine Modelle aus großen zu erstellen. Im besten Fall kann der Unterschied in der Aufgabenleistung zwischen dem "Lehrer"- und dem "Schüler"-Modell sehr gering sein.
tagEvaluierung auf BEIR
Die Vorteile der Optimierung und Knowledge Distillation kommen mit relativ geringen Leistungseinbußen. Im BEIR-Benchmark für Informationsabruf erreicht jina-reranker-v1-turbo-en knapp 95% der Genauigkeit von jina-reranker-v1-base-en, und jina-reranker-v1-tiny-en erreicht 92,5% der Punktzahl des Basismodells.
Alle Jina Reranker-Modelle sind wettbewerbsfähig mit anderen beliebten Reranker-Modellen, von denen die meisten viel größer sind.
| Model | BEIR Score (NDCC@10) | Parameters |
|---|---|---|
| Jina Reranker models | ||
| jina-reranker-v1-base-en | 52.45 | 137M |
| jina-reranker-v1-turbo-en | 49.60 | 38M |
| jina-reranker-v1-tiny-en | 48.54 | 33M |
| Other reranking models | ||
mxbai-rerank-base-v1 |
49.19 | 184M |
mxbai-rerank-xsmall-v1 |
48.80 | 71M |
ms-marco-MiniLM-L-6-v2 |
48.64 | 23M |
bge-reranker-base |
47.89 | 278M |
ms-marco-MiniLM-L-4-v2 |
47.81 | 19M |
NDCC@10: Punktzahlen berechnet mit Normalized Discounted Cumulative Gain für die Top-10-Ergebnisse.

Nur MiniLM-L6 (ms-marco-MiniLM-L-6-v2) und MiniLM-L4 (ms-marco-MiniLM-L-4-v2) haben vergleichbare Größen und Geschwindigkeiten, wobei jina-reranker-v1-turbo-en und jina-reranker-v1-tiny-en vergleichbar oder deutlich besser abschneiden.
Ähnliche Ergebnisse erhalten wir beim LlamaIndex RAG Benchmark. Wir haben alle drei Jina Rerankers in einem RAG-Setup mit drei Embedding-Modellen für die Vektorsuche getestet (jina-embeddings-v2-base-en, bge-base-en-v1.5 und Cohere-embed-english-v3.0) und die Scores gemittelt.
| Reranker Model | Avg. Hit Rate | Avg. MRR |
|---|---|---|
| Jina Reranker models | ||
| jina-reranker-v1-base-en | 0.8439 | 0.7006 |
| jina-reranker-v1-turbo-en | 0.8351 | 0.6498 |
| jina-reranker-v1-tiny-en | 0.8316 | 0.6761 |
| Other reranking models | ||
mxbai-rerank-base-v1 |
0.8105 | 0.6583 |
mxbai-rerank-xsmall-v1 |
0.8193 | 0.6673 |
ms-marco-MiniLM-L-6-v2 |
0.8052 | 0.6121 |
bge-reranker-base |
0.8175 | 0.6480 |
ms-marco-MiniLM-L-4-v2 |
0.8246 | 0.6354 |
MRR: Mean Reciprocal Rank
Bei Retrieval-Augmented Generation (RAG) Aufgaben sind die Qualitätsverluste sogar noch geringer als beim reinen BEIR Information Retrieval Benchmark. Und wenn man die RAG-Leistung neben der Verarbeitungsgeschwindigkeit betrachtet, sehen wir, dass nur ms-marco-MiniLM-L-4-v2 einen deutlich höheren Durchsatz bietet, allerdings auf Kosten einer signifikant niedrigeren Ergebnisqualität.

tagKosteneinsparungen auf AWS
Die Verwendung von Reranker Turbo und Reranker Tiny bietet große Einsparungen für AWS- und Azure-Nutzer, die für Speichernutzung und CPU-Zeit bezahlen. Obwohl das Ausmaß der Einsparungen je nach Anwendungsfall variiert, entspricht die etwa 75-prozentige Reduzierung der Speichernutzung direkt einer 75-prozentigen Einsparung bei Cloud-Systemen, die für Speicher berechnen.
Darüber hinaus bedeutet der schnellere Durchsatz, dass Sie mehr Anfragen auf günstigeren AWS-Instanzen ausführen können.
tagErste Schritte
Jina Reranker Modelle sind einfach zu verwenden und in Ihre Anwendungen und Workflows zu integrieren. Um zu beginnen, können Sie die Reranker API-Seite besuchen, um zu sehen, wie Sie unseren Service nutzen können und 1 Million kostenlose Token zum Testen erhalten.

Unsere Modelle sind auch auf AWS SageMaker verfügbar. Weitere Informationen finden Sie in unserem Tutorial zum Aufbau eines Retrieval-Augmented Generation Systems in AWS.


Jina Reranker Modelle stehen auch unter der Apache 2.0 Lizenz zum Download von Hugging Face zur Verfügung:








