Überblick
jina-reranker-v1-base-en ist ein englisches Cross-Encoder-Reranker-Modell mit 137M Parametern, das Suchergebnisse verfeinert, indem es eine Token-Level-Analyse von Query-Dokumenten-Paaren durchführt. Es liefert eine 20 % bessere Suchgenauigkeit gegenüber Baseline-Vektorsuche und ist damit das Arbeitspferd der ersten Jina-Reranker-Generation. Es wurde nun von den mehrsprachigen v2- und den listweisen v3-Familien abgelöst.
Methoden
Das Modell setzt eine BERT-basierte Cross-Attention-Architektur ein (12 Layer, 12 Attention-Heads, 768 versteckte Dimensionen, 137M Parameter), die sich fundamental von embedding-basierten Ansätzen unterscheidet. Statt vorher berechnete Dokument-Embeddings zu vergleichen, führt es dynamische Token-Level-Interaktionen zwischen Query und Dokument durch und erfasst dabei kontextuelle Nuancen, die Kosinus-Ähnlichkeit verpasst. Das 1.024-Token-Kontextfenster unterstützt automatisches Chunking und Max-Pooling über Chunks für längere Dokumente. Das Training nutzte einen kontrastiven Verlust auf Query-Dokument-Relevanzpaaren mit Hard-Negative-Mining. Das Modell war der erste Jina-Reranker und etablierte das Muster für die Turbo- und Tiny-Varianten durch Wissens-Destillation.
Leistung
Das Modell erzielt eine um 8 % höhere Trefferquote und einen um 33 % höheren mittleren reziproken Rang gegenüber Baseline-Vektorsuche. Auf BEIR erreicht es einen durchschnittlichen NDCG@10 von 0,5588 und übertrifft BGE (0,5032), BCE (0,4969) und Cohere (0,5141). Auf dem LoCo-Benchmark für Long-Context-Verständnis erzielt es 0,873, deutlich voraus gegenüber Mitbewerbern. Es zeigt besondere Stärke bei technischen Inhalten: 0,996 auf QASPER-Abstracts und 0,962 bei der Analyse von Regierungsberichten, obwohl die Performance bei Meeting-Zusammenfassungsaufgaben niedriger (0,466) ausfällt. Die Latenz skaliert mit der Dokumentlänge: 156 ms für 256 Tokens, 7.068 ms für 4.096 Tokens bei einer 512-Token-Query.
Anleitung
Implementieren Sie eine zweistufige Pipeline: Vektorsuche (z. B. jina-embeddings-v5-text-small) liefert die initialen Kandidaten, dann rangiert dieses Modell die Top 100–200 neu für Präzision. Das Modell ist nur englisch — für mehrsprachige Anwendungen nutzen Sie jina-reranker-v2-base-multilingual oder jina-reranker-v3.5. Es erfordert CUDA-fähige Hardware für Produktions-Durchsatz. Für neue Projekte bevorzugen Sie jina-reranker-v3.5 (mehrsprachig, listweise, 131K-Kontext, 63,20 BEIR NDCG@10). Das Modell ist über die Jina-Reranker-API, AWS SageMaker und Hugging Face verfügbar. Bei der Integration in RAG-Systeme stimmen Sie die Anzahl der zum Re-Ranking gesendeten Dokumente an Latenzanforderungen ab — 100–200 Dokumente gleichen Qualität und Geschwindigkeit typischerweise aus.










