Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Leser
Lesen Sie URLs und suchen Sie im Internet nach fundierteren LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
Elastic Inference Service
Jina-Modelle nativ in Elasticsearch ausführen.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumente
Einloggen
login
Reranker
copyright CC BY-NC 4.0
open_in_new Beitrag veröffentlichen

jina-reranker-m0

Mehrsprachiges multimodales Reranking-Modell zum Ranking visueller Dokumente
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2025-04-08
Eingang
abc
Text (Abfrage)
image
Bild (Abfrage)
abc
Text (Dokument)
image
Bild (Dokument)
arrow_forward
Ausgabe
format_list_numbered
Ranglisten
Modelldetails
Parameter: 2.4B
Länge des Eingabetokens: 10K
Eingabebildgröße: 768×28×28
Basismodell help_outline
open_in_new
Qwen2-VL-2B
Ausgebildete Sprachen help_outline
24 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Quantisierungen help_outline
GGUF
Ähnliche Modelle
link
jina-reranker-v2-base-multilingual
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-Gapped
E/A-Diagramm 1

mehrere

Text

Text

jina-reranker-m0

Rang

E/A-Diagramm 2

mehrere

Bild

Text

jina-reranker-m0

Rang

E/A-Diagramm 3

mehrere

Text

Bild

jina-reranker-m0

Rang

E/A-Diagramm 4

mehrere

Bild

Bild

jina-reranker-m0

Rang

Pareto fronthelp_outline
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameters (log)nDCG@5
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Werteverteilunghelp_outline
AUC 0.9383
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
0.7120.200.400.600.801.00
Verwandt83.2%
Hartes Negativ24.7%
Unverwandt9.3%
Empfohlene Schwellenwerte
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
ausgewogen · 0.692
AUC
0.9383
Rauschgrenze
0.965
Recall-Kante
0.425
Gemessene Paare
119 / 2,856
Score nach Ranghelp_outline
12345678910
Mittlerer Score je Rangposition
Was Rang 1 gewinnthelp_outline
Ein korrekter Treffer gewinnt 66 % von 119 Anfragen
Wählen Sie Modelle zum Vergleichen aus

Überblick

jina-reranker-m0 ist ein bahnbrechendes multimodales, mehrsprachiges Reranking-Modell, das visuelle Dokumente in mehreren Sprachen bewertet. Das Besondere an diesem Modell ist seine Fähigkeit, Abfragen neben visuell ansprechenden Dokumentbildern – einschließlich Seiten mit Text, Abbildungen, Tabellen und verschiedenen Layouts – in 29 Sprachen zu verarbeiten. Das Modell gibt eine Rangliste von Dokumenten aus, sortiert nach ihrer Relevanz für die eingegebene Abfrage. Im Gegensatz zu früheren Rerankern, die mit dem Problem der „Modalitätslücke“ zu kämpfen hatten (bei der Bilder in der Nähe anderer Bilder gruppiert wurden, während Text in der Nähe von Text gruppiert wurde), vereint jina-reranker-m0 Text- und Bildmodalitäten in einem einzigen Decoder-Modell und schafft so eine nahtlose multimodale Suche, die sowohl Bilder als auch Textdokumente effektiv zusammen bewerten kann.

Methoden

Die Architektur von jina-reranker-m0 stellt eine deutliche Abkehr von bisherigen Ansätzen dar. Basierend auf Qwen2-VL-2B mit 2,4 Milliarden Parametern wechselt sie von einer klassischen Cross-Encoder-Architektur zu einem Decoder-only-Vision-Language-Modell. Das System nutzt den vortrainierten Vision-Encoder und -Projektor von Qwen2-VL, optimiert sein großes Sprachmodell mit LoRA (Low-Rank Adaptation) und verwendet ein nachtrainiertes MLP zur Generierung von Ranking-Logits, die die Relevanz von Anfrage und Dokument messen. Dieses diskriminative Modell kann bis zu 32K Token verarbeiten und unterstützt Bilder von 56×56 Pixel bis hin zu 4K-Auflösung. Bei der Bildverarbeitung fassen der Vision Transformer (ViT) und der Projektor benachbarte 2×2-Token zu einzelnen visuellen Token zusammen, während spezielle Token die Grenzen der visuellen Token klar markieren. Dies ermöglicht dem Sprachmodell die korrekte Integration und Verknüpfung visueller und textueller Elemente.

Leistung

Jina-reranker-m0 erzielt beeindruckende Ergebnisse in mehreren Benchmarks. Beim Text-zu-Text-Reranking erreicht es im BEIR-Benchmark 58,95 NDCG-10 und übertrifft damit Konkurrenten wie jina-embeddings-v3 (55,81) und bge-reranker-v2-m3 (56,51). Für mehrsprachige Inhalte erreicht es im MIRACL-Benchmark für 18 Sprachen 66,75 NDCG-10. Im MLDR-Benchmark für lange Dokumente erreicht es 59,83 NDCG-10 in 13 Sprachen. Beim Code Retrieval im CoIR-Benchmark erreicht es 63,55 NDCG-10 und übertrifft damit die Konkurrenz deutlich. Doch das Modell glänzt wirklich beim visuellen Dokumentabruf: Beim ViDoRe-Benchmark erreicht es beeindruckende 91,02 NDCG-5, während es bei Winoground, das das visuell-linguistische Kompositionsschlussfolgern testet, einen Durchschnittswert von 43,92 erreicht und damit seine im Vergleich zu anderen Modellen überlegene Fähigkeit zum Verstehen von Beziehungen zwischen Text und Bildern unter Beweis stellt.

Anleitung

Um das Potenzial von jina-reranker-m0 voll auszuschöpfen, sollten Entwickler verschiedene Implementierungsstrategien in Betracht ziehen. Das Modell ist über API, Cloud-Service-Marktplätze (AWS, Azure, GCP) oder lokal über Hugging Face zugänglich. Bei Verwendung der API können Entwickler entweder Textzeichenfolgen, base64-Bilder oder Bild-URLs übergeben. Neue Nutzer erhalten zehn Millionen kostenlose Token. Dank umfangreichem Training ist das Modell bei Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Text-zu-gemischt-unimodalen Aufgaben außergewöhnlich leistungsstark. Beachten Sie jedoch, dass einige Kombinationen (z. B. Bild-zu-Bild) ohne spezielles Training nur zero-shot unterstützt werden. Für optimale Ergebnisse beachten Sie, dass das Modell bis zu 10.000 Eingabetoken mit bis zu 768 Token pro Bild unterstützt. Der Decoder-only-Ansatz der Architektur eröffnet Möglichkeiten, die über einfaches Reranking hinausgehen, darunter echtes Mixed-Modality-Reranking, listenweises Reranking, Dokumentdeduplizierung und Erklärbarkeit von Ranking-Ergebnissen über Aufmerksamkeitsmechanismen – Fähigkeiten, die mit früheren Encoder-only-Architekturen nicht erreichbar waren.
Blogs, die dieses Modell erwähnen
Oktober 03, 2025 • 7 Minuten gelesen
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
August 13, 2025 • 15 Minuten gelesen
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Juli 14, 2025 • 11 Minuten gelesen
Submodular Optimization for Text Selection, Passage Reranking & Context Engineering
While others rely on prompt tuning and hope for the best, you should learn submodular optimization that provides a principled framework with theoretical guarantees for better context engineering.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
Juni 25, 2025 • 12 Minuten gelesen
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
Mai 25, 2025 • 8 Minuten gelesen
Fair Scoring for Multimodal Documents with jina-reranker-m0
Text similarity: 0.7. Image similarity: 0.5. Which document is more relevant? You literally cannot tell—and that's the core problem breaking multimodal search. We solve it with unified reranking.
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Aktuelle Sprache / Design
Search Foundation
Leser
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Pressemitteilungen
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitTerms & amp; BedingungenPrivatsphäreCookie-EinstellungenMeine persönlichen Daten werden nicht verkauft oder weitergegeben.
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.