E/A-Diagramm 1

mehrere

Text

Text

jina-reranker-m0

Ranking

E/A-Diagramm 2

mehrere

Bild

Text

jina-reranker-m0

Ranking

E/A-Diagramm 3

mehrere

Text

Bild

jina-reranker-m0

Ranking

E/A-Diagramm 4

mehrere

Bild

Bild

jina-reranker-m0

Ranking

Pareto-Front
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameter (log)nDCG@5
Dieses Modell
Auf der Front
Jina AI
Andere
ViDoRe v1
91.02
Parameter
2.4B
Rang nach Score
7 / 24
Pareto-Front
Dahinter
Werteverteilung
AUC 0.9383
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
0.7120.200.400.600.801.00
Verwandt83.2%
Hartes Negativ24.7%
Unverwandt9.3%
Empfohlene Schwellenwerte
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
ausgewogen · 0.692
AUC
0.9383
Rauschgrenze
0.965
Recall-Kante
0.425
Gemessene Paare
119 / 2.856
Score nach Rang
12345678910
Mittlerer Score je Rangposition
Was Rang 1 gewinnt
Ein korrekter Treffer gewinnt 66 % von 119 Anfragen
Wählen Sie Modelle zum Vergleichen aus

Überblick

jina-reranker-m0 ist ein multimodaler, mehrsprachiger Reranker mit 2,4B Parametern, der auf einer Vision-Language-Modell-Architektur basiert. Es ist der erste Reranker, der visuelle Dokumente (Text, Abbildungen, Tabellen, Diagramme) in mehreren Sprachen bearbeitet, und erreicht State-of-the-Art-Leistung auf ViDoRe (91,02 NDCG-5) und beim mehrsprachigen Long-Document-Retrieval (MLDR). Das Modell unterstützt Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Mixed-Modality-Reranking.

Methoden

Das Modell basiert auf einer Decoder-Only-VLM-Architektur (2,4B Parameter), die einen DFN CLIP ViT-Vision-Encoder mit einem Qwen2-Sprachdekoder kombiniert. Im Gegensatz zu traditionellen Cross-Encodern, die nur Text verarbeiten, handhabt das VLM-Backbone nativ sowohl Text- als auch Bildeingaben und ermöglicht Reranking von Dokumenten mit visuellem Inhalt (gescannte PDFs, Infografiken, Folien, Tabellen mit eingebetteten Abbildungen). Das 10K-Token-Kontextfenster bietet Platz für bis zu 768 Token pro Bild (verarbeitet als 768×28×28-Patches). Das Training verwendet ein multimodales kontrastives Ziel über verschiedene Dokumenttypen hinweg in mehreren Sprachen. Die Decoder-Only-Architektur ermöglicht Listwise-Reranking und eröffnet Möglichkeiten für Dokumentdeduplizierung und Erklärbarkeit von Rangpunkten über Aufmerksamkeitsmechanismen — Fähigkeiten, die mit Encoder-Only-Architekturen nicht verfügbar sind.

Leistung

Beim Text-zu-Text-Reranking erzielt das Modell 58,95 NDCG-10 auf BEIR und übertrifft jina-embeddings-v3 (55,81) und bge-reranker-v2-m3 (56,51). Für mehrsprachige Inhalte erreicht es 66,75 NDCG-10 auf MIRACL (18 Sprachen). Auf dem MLDR-Benchmark für lange Dokumente erzielt es 59,83 NDCG-10 über 13 Sprachen hinweg. Code-Retrieval erreicht 63,55 NDCG-10 auf CoIR. Das Modell glänzt im visuellen Dokument-Retrieval: 91,02 NDCG-5 auf ViDoRe und 43,92 Durchschnitt auf Winoground (visio-linguistische kompositionelle Inferenz). Einige Modalitätskombinationen (z. B. Bild-zu-Bild) werden im Zero-Shot-Modus ohne spezifische Trainingsdaten unterstützt.

Anleitung

Das Modell ist über die Jina-API, AWS, Azure, GCP-Marktplätze oder lokal über Hugging Face verfügbar. Bei Nutzung der API übergeben Sie Textzeichenketten, Base64-Bilder oder Bild-URLs — neue Nutzer erhalten 10M kostenlose Token. Das Modell unterstützt bis zu 10K Eingabe-Token mit bis zu 768 Token pro Bild. Für optimale Ergebnisse erzielt das Modell die besten Leistungen bei Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Text-zu-Mixed-Modality-Aufgaben; Bild-zu-Bild ist zero-shot. Die Decoder-Only-Architektur ermöglicht Fähigkeiten jenseits einfachen Rerankings: Mixed-Modality-Reranking, Listwise-Reranking, Dokumentdeduplizierung und aufmerksamkeitsbasierte Ranking-Erklärbarkeit. Nutzen Sie dieses Modell, wenn Ihre Dokumente visuellen Inhalt (gescannte PDFs, Diagramme, Infografiken) enthalten, den text-only-Reranker nicht bewältigen können. Für reines Text-Reranking zu geringeren Kosten nutzen Sie jina-reranker-v3.5.

Blogs, die dieses Modell erwähnen
Oktober 03, 2025 • 7 Minuten gelesen
Jina Reranker v3: 0.6B Listwise Reranker für SOTA Multilingual Retrieval
Ein neuer Listwise-Reranker mit 0,6 Milliarden Parametern, der die Anfrage und alle Kandidatendokumente in einem einzigen Kontextfenster berücksichtigt.
August 13, 2025 • 15 Minuten gelesen
GGUFs für Decoder-Only 向量模型 optimieren
4000 Tokens/Sekunde für ein 3B-Parameter-Vektor-Modell auf einer L4-GPU ist wahrscheinlich das Schnellste, was man mit llama.cpp erreichen kann. Oder etwa nicht?
Juli 14, 2025 • 11 Minuten gelesen
Submodulare Optimierung für Textauswahl, Passage-Reranking & Kontext-Engineering
Während andere auf Prompt-Tuning setzen und auf das Beste hoffen, solltest du die submodulare Optimierung erlernen, die einen prinzipiellen Rahmen mit theoretischen Garantien für ein besseres Kontext-Engineering bietet.
Juni 25, 2025 • 12 Minuten gelesen
Jina Embeddings v4: Universelle Vektor Modelle (Embeddings) für Multimodale, Mehrsprachige Suche
Jina Embeddings v4 ist ein universelles 向量模型 (Embeddings)-Modell mit 3,8 Milliarden Parametern für multimodale und mehrsprachige Suche, das sowohl Single-Vektor- als auch Multi-Vektor-Embedding-Ausgaben unterstützt.
Mai 25, 2025 • 8 Minuten gelesen
Faires Scoring für Multimodale Dokumente mit jina-reranker-m0
Textähnlichkeit: 0.7. Bildähnlichkeit: 0.5. Welches Dokument ist relevanter? Sie können es buchstäblich nicht sagen – und das ist das Kernproblem, das die multimodale Suche behindert. Wir lösen es mit Unified Reranking (einheitlicher Reranker).