Überblick
jina-reranker-v2-base-multilingual ist ein 278M-Parameter Cross-Encoder-Reranker, der 100+ Sprachen mit einem 1.024-Token-Kontextfenster unterstützt (524.288 Tokens mit Flash Attention 2). Er war der erste Jina-Reranker, der die nur-englisch-Beschränkung brach, und lieferte State-of-the-Art-Performance auf AirBench sowie starke Ergebnisse in strukturierten Daten-Aufgaben, einschließlich Funktionsaufrufen und SQL-Schema-Matching. Er verarbeitet Dokumente 15× schneller als vergleichbare Modelle.
Methoden
Das Modell setzt eine Cross-Encoder-Architektur mit Flash Attention 2 ein, die direkten Vergleich zwischen Queries und Dokumenten über Sprachbarrieren hinweg ermöglicht. Der 278M-Parameter BERT-basierte Encoder verwendet symmetrische bidirektionale Attention mit ALiBi-Position-Encodings für den 1.024-Token-Basis-Kontext (erweiterbar auf 524.288 Tokens mit Flash Attention 2). Das Training folgte einem vierstufigen progressiven Prozess: (1) Sprachfähigkeiten in Englisch, (2) cross-linguales Alignement, (3) Einbeziehung mehrsprachiger Daten, (4) Verfeinerung über schwierige Negative. Dieser gestufte Ansatz verhinderte das katastrophale Vergessen, das häufig auftritt, wenn mehrsprachige Daten einem Ein-Sprache-Modell hinzugefügt werden. Die Flash-Attention-2-Implementierung ist eine Schlüssel-Effizienz-Innovation, die 15× höheren Durchsatz als bge-reranker-v2-m3 ermöglicht.
Leistung
Das Modell erzielt State-of-the-Art-Performance auf dem AirBench-Leaderboard für RAG-Systeme und starke Ergebnisse auf MKQA (26 Sprachen). Es ist besonders stark in strukturierten Daten-Aufgaben: hohe Recall auf ToolBench (Funktionsaufrufe) und NSText2SQL (SQL-Schema-Matching). Am beeindruckendsten verarbeitet es Dokumente 15× schneller als vergleichbare Modelle wie bge-reranker-v2-m3 und macht es damit für Echtzeit-Anwendungen praktikabel. Die 100+ Sprachen-Unterstützung und die strukturierten Daten-Fähigkeiten machen es einzigartig geeignet für agentische RAG-Systeme und mehrsprachige API-Dokumentationssuche. Im Jahr 2026 ersetzt jina-reranker-v3.5 dieses Modell durch listweise Interaktion, 131K-Kontext und domänenspezifisches Training.
Anleitung
Das Modell benötigt eine CUDA-fähige GPU und ist über die Jina-Reranker-API, große RAG-Frameworks (Haystack, LangChain) und Cloud-Marketplaces (AWS, Azure, GCP) verfügbar. Es ist besonders stark in Szenarien, die präzises Verständnis über Sprach- und Datentypbarrieren hinweg erfordern: globale Unternehmen mit mehrsprachigen Inhalten, API-Dokumentationssuche und Code-Retrieval über mehrsprachige Codebasen hinweg. Mit dem 1.024-Token-Kontextfenster und automatischem Chunking für längere Dokumente bearbeitet es erweiterte Inhalte effizient. Verwenden Sie dieses Modell, wenn Sie die Suchgenauigkeit über Sprachen hinweg verbessern, Funktionsaufruf-Fähigkeiten für agentische RAG benötigen oder die Codesuche über mehrsprachige Codebasen verbessern möchten. Für neue Projekte bietet jina-reranker-v3.5 listweises Ranking, 131K-Kontext und domänenspezifische Verbesserungen.









