E/A-Diagramm

mehrere

Dokument

Abfrage

jina-reranker-v1

Ranking

Pareto-Front
30M100M7075808590ColBERTv2gte-reranker-modernbert…jina-colbert-v1-enjina-reranker-v1-base-enjina-reranker-v1-turbo-…jina-reranker-v1-tiny-enParameter (log)nDCG@10
Dieses Modell
Auf der Front
Jina AI
Andere
LoCo
70.29
Parameter
33M
Rang nach Score
5 / 6
Pareto-Front
Darauf
Werteverteilung
AUC 0.7482
Korpus
Übersetzungspaare
0.8760.200.400.600.80
Verwandt4.0%
Hartes Negativ2.3%
Unverwandt0.4%
Empfohlene Schwellenwerte
FPR 0.1 · 0.596
FPR 0.01 · 0.876
FPR 0.001 · 0.892
FPR 0.0001 · 0.928
ausgewogen · 0.280
AUC
0.7482
Rauschgrenze
0.890
Recall-Kante
0.198
Gemessene Paare
100 / 9.200
Score nach Rang
12345678910
Mittlerer Score je Rangposition
Wählen Sie Modelle zum Vergleichen aus

Überblick

jina-reranker-v1-tiny-en ist ein englisches Cross-Encoder-Reranker-Modell mit 33M Parametern — das kleinste in der Jina-v1-Familie. Durch aggressive Wissens-Destillation behält es 92,5 % der Genauigkeit des Basis-Modells bei, verarbeitet Dokumente fünfmal schneller und verwendet 13 % weniger Speicher als die Turbo-Variante. Es ist für Edge-Computing, Mobile-Anwendungen und Hochdurchsatz-Suchsysteme mit strengen Latenzbudgets konzipiert.

Methoden

Das Modell setzt eine schlankere Vier-Schicht-Architektur auf JinaBERT-Basis mit symmetrischen bidirektionalen ALiBi-Position-Encodings ein. Ihre Entwicklung nutzt Wissens-Destillation aus dem 137M-Parameter-Modell jina-reranker-v1-base-en, das als Lehrermodell dient. Das Schülermodell lernt optimale Ranking-Verhaltensweisen ohne umfangreiche Trainingsdaten aus der Praxis und gleicht den weichen Ranking-Verteilungen des Lehrers, während es nur 33M Parameter verwendet. Das Vier-Schicht-Design und die reduzierten versteckten Dimensionen ermöglichen die 5×-Beschleunigung gegenüber dem Basis-Modell. Das Modell unterstützt 1.024-Tokens Kontext mit automatischem Chunking für längere Dokumente.

Leistung

Auf BEIR erreicht das Modell einen NDCG{'@'}10 von 48,54 und behält 92,5 % der Performance des Basis-Modells (52,45) bei, während es nur ein Viertel seiner Größe beträgt. In LlamaIndex-RAG-Benchmarks hält es eine 83,16 % Trefferquote und gleicht nahezu größeren Modellen, während es Dokumente deutlich schneller verarbeitet. Der Durchsatz ist nahezu fünfmal schneller als das Basis-Modell, mit 13 % weniger Speicherbedarf als die Turbo-Variante. Diese Metriken messen sich mit oder übertreffen deutlich größere Modelle wie mxbai-rerank-base-v1 (184M) und bge-reranker-base (278M). Die Performance-Größen-Abwägung macht es einzigartig geeignet für ressourcenbeschränkte Deployments.

Anleitung

Priorisieren Sie Szenarien, in denen Verarbeitungsgeschwindigkeit und Ressourceneffizienz kritisch sind: Edge-Computing, Mobile-Anwendungen und Hochdurchsatz-Suchsysteme mit strengen Latenzbudgets. Für Anwendungen, die absolute maximale Ranking-Präzision erfordern, ist das Basis-Modell oder jina-reranker-v3.5 vorzuziehen. Das Modell benötigt eine CUDA-fähige GPU für optimale Performance, läuft aber auf weniger leistungsfähiger Hardware als größere Gegenstücke. Es integriert sich in große Vektordatenbanken und RAG-Frameworks und ist über die Jina-Reranker-API und AWS SageMaker verfügbar. Das Modell ist nur englisch; für mehrsprachige Anwendungen nutzen Sie jina-reranker-v2-base-multilingual oder jina-reranker-v3.5. Bei Fine-Tuning für bestimmte Domänen balancieren Sie die Qualität der Trainingsdaten sorgfältig mit der kompakten Architektur des Modells, um Performance-Eigenschaften beizubehalten.

Blogs, die dieses Modell erwähnen