Überblick
jina-reranker-m0 ist ein multimodaler, mehrsprachiger Reranker mit 2,4B Parametern, der auf einer Vision-Language-Modell-Architektur basiert. Es ist der erste Reranker, der visuelle Dokumente (Text, Abbildungen, Tabellen, Diagramme) in mehreren Sprachen bearbeitet, und erreicht State-of-the-Art-Leistung auf ViDoRe (91,02 NDCG-5) und beim mehrsprachigen Long-Document-Retrieval (MLDR). Das Modell unterstützt Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Mixed-Modality-Reranking.
Methoden
Das Modell basiert auf einer Decoder-Only-VLM-Architektur (2,4B Parameter), die einen DFN CLIP ViT-Vision-Encoder mit einem Qwen2-Sprachdekoder kombiniert. Im Gegensatz zu traditionellen Cross-Encodern, die nur Text verarbeiten, handhabt das VLM-Backbone nativ sowohl Text- als auch Bildeingaben und ermöglicht Reranking von Dokumenten mit visuellem Inhalt (gescannte PDFs, Infografiken, Folien, Tabellen mit eingebetteten Abbildungen). Das 10K-Token-Kontextfenster bietet Platz für bis zu 768 Token pro Bild (verarbeitet als 768×28×28-Patches). Das Training verwendet ein multimodales kontrastives Ziel über verschiedene Dokumenttypen hinweg in mehreren Sprachen. Die Decoder-Only-Architektur ermöglicht Listwise-Reranking und eröffnet Möglichkeiten für Dokumentdeduplizierung und Erklärbarkeit von Rangpunkten über Aufmerksamkeitsmechanismen — Fähigkeiten, die mit Encoder-Only-Architekturen nicht verfügbar sind.
Leistung
Beim Text-zu-Text-Reranking erzielt das Modell 58,95 NDCG-10 auf BEIR und übertrifft jina-embeddings-v3 (55,81) und bge-reranker-v2-m3 (56,51). Für mehrsprachige Inhalte erreicht es 66,75 NDCG-10 auf MIRACL (18 Sprachen). Auf dem MLDR-Benchmark für lange Dokumente erzielt es 59,83 NDCG-10 über 13 Sprachen hinweg. Code-Retrieval erreicht 63,55 NDCG-10 auf CoIR. Das Modell glänzt im visuellen Dokument-Retrieval: 91,02 NDCG-5 auf ViDoRe und 43,92 Durchschnitt auf Winoground (visio-linguistische kompositionelle Inferenz). Einige Modalitätskombinationen (z. B. Bild-zu-Bild) werden im Zero-Shot-Modus ohne spezifische Trainingsdaten unterstützt.
Anleitung
Das Modell ist über die Jina-API, AWS, Azure, GCP-Marktplätze oder lokal über Hugging Face verfügbar. Bei Nutzung der API übergeben Sie Textzeichenketten, Base64-Bilder oder Bild-URLs — neue Nutzer erhalten 10M kostenlose Token. Das Modell unterstützt bis zu 10K Eingabe-Token mit bis zu 768 Token pro Bild. Für optimale Ergebnisse erzielt das Modell die besten Leistungen bei Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Text-zu-Mixed-Modality-Aufgaben; Bild-zu-Bild ist zero-shot. Die Decoder-Only-Architektur ermöglicht Fähigkeiten jenseits einfachen Rerankings: Mixed-Modality-Reranking, Listwise-Reranking, Dokumentdeduplizierung und aufmerksamkeitsbasierte Ranking-Erklärbarkeit. Nutzen Sie dieses Modell, wenn Ihre Dokumente visuellen Inhalt (gescannte PDFs, Diagramme, Infografiken) enthalten, den text-only-Reranker nicht bewältigen können. Für reines Text-Reranking zu geringeren Kosten nutzen Sie jina-reranker-v3.5.








