Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Optimierte Architektur
Knowledge Distillation
Evaluierung auf BEIR
Kosteneinsparungen auf AWS
Erste Schritte
Pressemitteilung
April 18, 2024

Kleiner, Schneller, Günstiger: Die Vorstellung von Jina Rerankers Turbo und Tiny

Jina AI kündigt neue Reranker-Modelle an: Jina Rerankers Turbo (jina-reranker-v1-turbo-en) und Tiny (jina-reranker-v1-tiny-en), die jetzt auf AWS Sagemaker und Hugging Face verfügbar sind und ein schnelleres, speichereffizientes und leistungsstarkes Reranking ermöglichen.
Four interconnected white wireframe spheres on a deep blue background, symbolizing global networking and technological connec
Yuting Zhang, Scott Martens • 7 Minuten gelesen

Jina AI kündigt neue Modelle in ihrer Familie von hochmodernen Reranker-Modellen an, die jetzt auf AWS Sagemaker und Hugging Face verfügbar sind: jina-reranker-v1-turbo-en und jina-reranker-v1-tiny-en. Diese Modelle priorisieren Geschwindigkeit und Größe bei gleichzeitiger Beibehaltung hoher Leistung in Standard-Benchmarks und bieten einen schnelleren und speichereffizienteren Reranking-Prozess für Umgebungen, in denen Antwortzeit und Ressourcennutzung kritisch sind.

AWS Marketplace: Jina AI
jinaai/jina-reranker-v1-turbo-en · Hugging Face
We're on a journey to advance and democratize artificial intelligence through open source and open science.
jinaai/jina-reranker-v1-tiny-en · Hugging Face
We're on a journey to advance and democratize artificial intelligence through open source and open science.

Reranker Turbo und Tiny sind für blitzschnelle Antwortzeiten in Informationsabruf-Anwendungen optimiert. Wie unsere Embedding-Modelle verwenden sie die JinaBERT-Architektur, eine Variante der BERT-Architektur, erweitert um eine symmetrische bidirektionale Variante von ALiBi. Diese Architektur ermöglicht die Unterstützung langer Textsequenzen, wobei unsere Modelle bis zu 8.192 Token verarbeiten können – ideal für die tiefgehende Analyse größerer Dokumente und komplexer Abfragen, die detailliertes Sprachverständnis erfordern.

Die Turbo- und Tiny-Modelle basieren auf Erkenntnissen aus dem Jina Reranker v1. Reranking kann ein großer Engpass für Informationsabruf-Anwendungen sein. Traditionelle Suchanwendungen sind eine sehr ausgereifte Technologie, deren Leistung gut verstanden wird. Reranker fügen der textbasierten Suche eine hohe Präzision hinzu, aber KI-Modelle sind groß und können langsam und teuer in der Ausführung sein.

Viele Benutzer würden ein kleineres, schnelleres, günstigeres Modell bevorzugen, auch wenn dies zu Lasten der Genauigkeit geht. Ein einzelnes Ziel – das Reranking von Suchergebnissen – macht es möglich, das Modell zu optimieren und den Benutzern wettbewerbsfähige Leistung in viel kompakteren Modellen zu bieten. Durch die Verwendung von weniger versteckten Schichten beschleunigen wir die Verarbeitung und reduzieren die Modellgröße. Diese Modelle sind günstiger in der Ausführung, und die höhere Geschwindigkeit macht sie nützlicher für Anwendungen, die keine hohe Latenz tolerieren können, während sie fast die gesamte Leistung größerer Modelle beibehalten.

In diesem Artikel zeigen wir Ihnen die Architektur von Reranker Turbo und Reranker Tiny, messen ihre Leistung und zeigen Ihnen, wie Sie damit beginnen können.

tagOptimierte Architektur

Jina Reranker Turbo (jina-reranker-v1-turbo-en) verwendet eine sechsschichtige Architektur mit insgesamt 37,8 Millionen Parametern, im Gegensatz zu den 137 Millionen Parametern und zwölf Schichten des Basis-Reranker-Modells jina-reranker-v1-base-en. Dies bedeutet eine Reduzierung der Modellgröße um drei Viertel und eine bis zu dreifache Steigerung der Verarbeitungsgeschwindigkeit.

Reranker Tiny (jina-reranker-v1-tiny-en) verwendet vier Schichten mit 33 Millionen Parametern und bietet damit noch höhere parallele Verarbeitung und schnellere Geschwindigkeiten – fast fünfmal so schnell wie das Basis-Reranker-Modell – während 13% der Speicherkosten gegenüber dem Turbo-Modell eingespart werden.

Graph comparing performance of Jina Reranker versions with bars representing documents processed per 50ms.
Dokumenten-Durchsatz für Jina Reranker-Modelle

tagKnowledge Distillation

Wir haben Reranker Turbo und Tiny mittels Knowledge Distillation trainiert. Dies ist eine Technik, bei der ein bestehendes KI-Modell verwendet wird, um ein anderes zu trainieren, damit es sein Verhalten nachahmt. Anstatt externe Datenquellen zu verwenden, nutzen wir ein bestehendes Modell zur Generierung von Trainingsdaten. Wir verwendeten das Jina Reranker Base-Modell, um Dokumentensammlungen zu ranken, und nutzten diese Ergebnisse dann zum Training von Turbo und Tiny. Auf diese Weise können wir viel mehr Daten in den Trainingsprozess einbringen, da wir nicht durch verfügbare reale Daten eingeschränkt sind.

Dies ist ein wenig wie ein Schüler, der von einem Lehrer lernt: Das bereits trainierte, leistungsstarke Modell – das Jina Reranker Base-Modell – "lehrt" die untrainierten Jina Turbo- und Jina Tiny-Modelle, indem es neue Trainingsdaten generiert. Diese Technik wird häufig verwendet, um kleine Modelle aus großen zu erstellen. Im besten Fall kann der Unterschied in der Aufgabenleistung zwischen dem "Lehrer"- und dem "Schüler"-Modell sehr gering sein.

tagEvaluierung auf BEIR

Die Vorteile der Optimierung und Knowledge Distillation kommen mit relativ geringen Leistungseinbußen. Im BEIR-Benchmark für Informationsabruf erreicht jina-reranker-v1-turbo-en knapp 95% der Genauigkeit von jina-reranker-v1-base-en, und jina-reranker-v1-tiny-en erreicht 92,5% der Punktzahl des Basismodells.

Alle Jina Reranker-Modelle sind wettbewerbsfähig mit anderen beliebten Reranker-Modellen, von denen die meisten viel größer sind.

Model BEIR Score (NDCC@10) Parameters
Jina Reranker models
jina-reranker-v1-base-en 52.45 137M
jina-reranker-v1-turbo-en 49.60 38M
jina-reranker-v1-tiny-en 48.54 33M
Other reranking models
mxbai-rerank-base-v1 49.19 184M
mxbai-rerank-xsmall-v1 48.80 71M
ms-marco-MiniLM-L-6-v2 48.64 23M
bge-reranker-base 47.89 278M
ms-marco-MiniLM-L-4-v2 47.81 19M

NDCC@10: Punktzahlen berechnet mit Normalized Discounted Cumulative Gain für die Top-10-Ergebnisse.

Chart displaying BEIR scores for various reranker projects, assessing model performance over documents processed per 50ms.
BEIR Benchmark: Durchsatz (x-Achse) vs. Punktzahl (y-Achse)(Beachten Sie, dass die y-Achse nicht beim Ursprung beginnt. Wir beginnen mit einem höheren BIER-Punktwert, um die Lesbarkeit des Graphen zu verbessern.)

Nur MiniLM-L6 (ms-marco-MiniLM-L-6-v2) und MiniLM-L4 (ms-marco-MiniLM-L-4-v2) haben vergleichbare Größen und Geschwindigkeiten, wobei jina-reranker-v1-turbo-en und jina-reranker-v1-tiny-en vergleichbar oder deutlich besser abschneiden.

Ähnliche Ergebnisse erhalten wir beim LlamaIndex RAG Benchmark. Wir haben alle drei Jina Rerankers in einem RAG-Setup mit drei Embedding-Modellen für die Vektorsuche getestet (jina-embeddings-v2-base-en, bge-base-en-v1.5 und Cohere-embed-english-v3.0) und die Scores gemittelt.

Reranker Model Avg. Hit Rate Avg. MRR
Jina Reranker models
jina-reranker-v1-base-en 0.8439 0.7006
jina-reranker-v1-turbo-en 0.8351 0.6498
jina-reranker-v1-tiny-en 0.8316 0.6761
Other reranking models
mxbai-rerank-base-v1 0.8105 0.6583
mxbai-rerank-xsmall-v1 0.8193 0.6673
ms-marco-MiniLM-L-6-v2 0.8052 0.6121
bge-reranker-base 0.8175 0.6480
ms-marco-MiniLM-L-4-v2 0.8246 0.6354

MRR: Mean Reciprocal Rank

Bei Retrieval-Augmented Generation (RAG) Aufgaben sind die Qualitätsverluste sogar noch geringer als beim reinen BEIR Information Retrieval Benchmark. Und wenn man die RAG-Leistung neben der Verarbeitungsgeschwindigkeit betrachtet, sehen wir, dass nur ms-marco-MiniLM-L-4-v2 einen deutlich höheren Durchsatz bietet, allerdings auf Kosten einer signifikant niedrigeren Ergebnisqualität.

Scatter plot showing hit rate versus document speed for language models, with highlighted ones like "jina-reranker" and "ms-m
LlamaIndex RAG Benchmark: Durchsatz (x-Achse) vs. Trefferquote (y-Achse)(Beachten Sie, dass die y-Achse nicht beim Ursprung beginnt. Wir beginnen mit einem höheren Trefferquotenwert, um die Lesbarkeit des Graphen zu verbessern.)

tagKosteneinsparungen auf AWS

Die Verwendung von Reranker Turbo und Reranker Tiny bietet große Einsparungen für AWS- und Azure-Nutzer, die für Speichernutzung und CPU-Zeit bezahlen. Obwohl das Ausmaß der Einsparungen je nach Anwendungsfall variiert, entspricht die etwa 75-prozentige Reduzierung der Speichernutzung direkt einer 75-prozentigen Einsparung bei Cloud-Systemen, die für Speicher berechnen.

Darüber hinaus bedeutet der schnellere Durchsatz, dass Sie mehr Anfragen auf günstigeren AWS-Instanzen ausführen können.

tagErste Schritte

Jina Reranker Modelle sind einfach zu verwenden und in Ihre Anwendungen und Workflows zu integrieren. Um zu beginnen, können Sie die Reranker API-Seite besuchen, um zu sehen, wie Sie unseren Service nutzen können und 1 Million kostenlose Token zum Testen erhalten.

Reranker API
Maximize the search relevancy and RAG accuracy at ease

Unsere Modelle sind auch auf AWS SageMaker verfügbar. Weitere Informationen finden Sie in unserem Tutorial zum Aufbau eines Retrieval-Augmented Generation Systems in AWS.

AWS Marketplace: Jina AI
Next-Level Cloud AI: Jina Embeddings and Rerankers on Amazon SageMaker
Learn to use Jina Embeddings and Reranking models in a full-stack AI application on AWS, using only components available in Amazon SageMaker and the AWS Marketplace.
Signup

Jina Reranker Modelle stehen auch unter der Apache 2.0 Lizenz zum Download von Hugging Face zur Verfügung:

jinaai/jina-reranker-v1-turbo-en · Hugging Face
We're on a journey to advance and democratize artificial intelligence through open source and open science.
jinaai/jina-reranker-v1-tiny-en · Hugging Face
Wir sind auf einer Reise, künstliche Intelligenz durch Open Source und Open Science voranzubringen und zu demokratisieren.
Kategorien:
Pressemitteilung
rss_feed

Weiterlesen
August 03, 2026 • 11 Minuten gelesen
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
Mai 12, 2026 • 7 Minuten gelesen
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
Februar 19, 2026 • 7 Minuten gelesen
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.