E/A-Diagramm 1
E/A-Diagramm 2
E/A-Diagramm 3
E/A-Diagramm 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Werteverteilunghelp_outlineAUC 0.9383
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
Verwandt83.2%
Hartes Negativ24.7%
Unverwandt9.3%
Empfohlene Schwellenwerte
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
ausgewogen · 0.692
AUC
0.9383
Rauschgrenze
0.965
Recall-Kante
0.425
Gemessene Paare
119 / 2,856
Score nach Ranghelp_outline
Mittlerer Score je Rangposition
Was Rang 1 gewinnthelp_outline
Ein korrekter Treffer gewinnt 66 % von 119 Anfragen
Wählen Sie Modelle zum Vergleichen aus
Überblick
jina-reranker-m0 ist ein bahnbrechendes multimodales, mehrsprachiges Reranking-Modell, das visuelle Dokumente in mehreren Sprachen bewertet. Das Besondere an diesem Modell ist seine Fähigkeit, Abfragen neben visuell ansprechenden Dokumentbildern – einschließlich Seiten mit Text, Abbildungen, Tabellen und verschiedenen Layouts – in 29 Sprachen zu verarbeiten. Das Modell gibt eine Rangliste von Dokumenten aus, sortiert nach ihrer Relevanz für die eingegebene Abfrage. Im Gegensatz zu früheren Rerankern, die mit dem Problem der „Modalitätslücke“ zu kämpfen hatten (bei der Bilder in der Nähe anderer Bilder gruppiert wurden, während Text in der Nähe von Text gruppiert wurde), vereint jina-reranker-m0 Text- und Bildmodalitäten in einem einzigen Decoder-Modell und schafft so eine nahtlose multimodale Suche, die sowohl Bilder als auch Textdokumente effektiv zusammen bewerten kann.
Methoden
Die Architektur von jina-reranker-m0 stellt eine deutliche Abkehr von bisherigen Ansätzen dar. Basierend auf Qwen2-VL-2B mit 2,4 Milliarden Parametern wechselt sie von einer klassischen Cross-Encoder-Architektur zu einem Decoder-only-Vision-Language-Modell. Das System nutzt den vortrainierten Vision-Encoder und -Projektor von Qwen2-VL, optimiert sein großes Sprachmodell mit LoRA (Low-Rank Adaptation) und verwendet ein nachtrainiertes MLP zur Generierung von Ranking-Logits, die die Relevanz von Anfrage und Dokument messen. Dieses diskriminative Modell kann bis zu 32K Token verarbeiten und unterstützt Bilder von 56×56 Pixel bis hin zu 4K-Auflösung. Bei der Bildverarbeitung fassen der Vision Transformer (ViT) und der Projektor benachbarte 2×2-Token zu einzelnen visuellen Token zusammen, während spezielle Token die Grenzen der visuellen Token klar markieren. Dies ermöglicht dem Sprachmodell die korrekte Integration und Verknüpfung visueller und textueller Elemente.
Leistung
Jina-reranker-m0 erzielt beeindruckende Ergebnisse in mehreren Benchmarks. Beim Text-zu-Text-Reranking erreicht es im BEIR-Benchmark 58,95 NDCG-10 und übertrifft damit Konkurrenten wie jina-embeddings-v3 (55,81) und bge-reranker-v2-m3 (56,51). Für mehrsprachige Inhalte erreicht es im MIRACL-Benchmark für 18 Sprachen 66,75 NDCG-10. Im MLDR-Benchmark für lange Dokumente erreicht es 59,83 NDCG-10 in 13 Sprachen. Beim Code Retrieval im CoIR-Benchmark erreicht es 63,55 NDCG-10 und übertrifft damit die Konkurrenz deutlich. Doch das Modell glänzt wirklich beim visuellen Dokumentabruf: Beim ViDoRe-Benchmark erreicht es beeindruckende 91,02 NDCG-5, während es bei Winoground, das das visuell-linguistische Kompositionsschlussfolgern testet, einen Durchschnittswert von 43,92 erreicht und damit seine im Vergleich zu anderen Modellen überlegene Fähigkeit zum Verstehen von Beziehungen zwischen Text und Bildern unter Beweis stellt.
Anleitung
Um das Potenzial von jina-reranker-m0 voll auszuschöpfen, sollten Entwickler verschiedene Implementierungsstrategien in Betracht ziehen. Das Modell ist über API, Cloud-Service-Marktplätze (AWS, Azure, GCP) oder lokal über Hugging Face zugänglich. Bei Verwendung der API können Entwickler entweder Textzeichenfolgen, base64-Bilder oder Bild-URLs übergeben. Neue Nutzer erhalten zehn Millionen kostenlose Token. Dank umfangreichem Training ist das Modell bei Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Text-zu-gemischt-unimodalen Aufgaben außergewöhnlich leistungsstark. Beachten Sie jedoch, dass einige Kombinationen (z. B. Bild-zu-Bild) ohne spezielles Training nur zero-shot unterstützt werden. Für optimale Ergebnisse beachten Sie, dass das Modell bis zu 10.000 Eingabetoken mit bis zu 768 Token pro Bild unterstützt. Der Decoder-only-Ansatz der Architektur eröffnet Möglichkeiten, die über einfaches Reranking hinausgehen, darunter echtes Mixed-Modality-Reranking, listenweises Reranking, Dokumentdeduplizierung und Erklärbarkeit von Ranking-Ergebnissen über Aufmerksamkeitsmechanismen – Fähigkeiten, die mit früheren Encoder-only-Architekturen nicht erreichbar waren.
Blogs, die dieses Modell erwähnen








