Überblick
jina-reranker-v1-tiny-en ist ein englisches Cross-Encoder-Reranker-Modell mit 33M Parametern — das kleinste in der Jina-v1-Familie. Durch aggressive Wissens-Destillation behält es 92,5 % der Genauigkeit des Basis-Modells bei, verarbeitet Dokumente fünfmal schneller und verwendet 13 % weniger Speicher als die Turbo-Variante. Es ist für Edge-Computing, Mobile-Anwendungen und Hochdurchsatz-Suchsysteme mit strengen Latenzbudgets konzipiert.
Methoden
Das Modell setzt eine schlankere Vier-Schicht-Architektur auf JinaBERT-Basis mit symmetrischen bidirektionalen ALiBi-Position-Encodings ein. Ihre Entwicklung nutzt Wissens-Destillation aus dem 137M-Parameter-Modell jina-reranker-v1-base-en, das als Lehrermodell dient. Das Schülermodell lernt optimale Ranking-Verhaltensweisen ohne umfangreiche Trainingsdaten aus der Praxis und gleicht den weichen Ranking-Verteilungen des Lehrers, während es nur 33M Parameter verwendet. Das Vier-Schicht-Design und die reduzierten versteckten Dimensionen ermöglichen die 5×-Beschleunigung gegenüber dem Basis-Modell. Das Modell unterstützt 1.024-Tokens Kontext mit automatischem Chunking für längere Dokumente.
Leistung
Auf BEIR erreicht das Modell einen NDCG@10 von 48,54 und behält 92,5 % der Performance des Basis-Modells (52,45) bei, während es nur ein Viertel seiner Größe beträgt. In LlamaIndex-RAG-Benchmarks hält es eine 83,16 % Trefferquote und gleicht nahezu größeren Modellen, während es Dokumente deutlich schneller verarbeitet. Der Durchsatz ist nahezu fünfmal schneller als das Basis-Modell, mit 13 % weniger Speicherbedarf als die Turbo-Variante. Diese Metriken messen sich mit oder übertreffen deutlich größere Modelle wie mxbai-rerank-base-v1 (184M) und bge-reranker-base (278M). Die Performance-Größen-Abwägung macht es einzigartig geeignet für ressourcenbeschränkte Deployments.
Anleitung
Priorisieren Sie Szenarien, in denen Verarbeitungsgeschwindigkeit und Ressourceneffizienz kritisch sind: Edge-Computing, Mobile-Anwendungen und Hochdurchsatz-Suchsysteme mit strengen Latenzbudgets. Für Anwendungen, die absolute maximale Ranking-Präzision erfordern, ist das Basis-Modell oder jina-reranker-v3.5 vorzuziehen. Das Modell benötigt eine CUDA-fähige GPU für optimale Performance, läuft aber auf weniger leistungsfähiger Hardware als größere Gegenstücke. Es integriert sich in große Vektordatenbanken und RAG-Frameworks und ist über die Jina-Reranker-API und AWS SageMaker verfügbar. Das Modell ist nur englisch; für mehrsprachige Anwendungen nutzen Sie jina-reranker-v2-base-multilingual oder jina-reranker-v3.5. Bei Fine-Tuning für bestimmte Domänen balancieren Sie die Qualität der Trainingsdaten sorgfältig mit der kompakten Architektur des Modells, um Performance-Eigenschaften beizubehalten.





