Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login
Reranker
copyright CC BY-NC 4.0
open_in_new Release-Post

jina-reranker-m0

Mehrsprachiges multimodales Reranking-Modell zum Ranking visueller Dokumente
Lizenz
copyright CC-BY-NC-4.0
Veröffentlichungsdatum
calendar_month
2025-04-08
Eingabe
abc
Text (Abfrage)
image
Bild (Abfrage)
abc
Text (Dokument)
image
Bild (Dokument)
arrow_forward
Ausgabe
format_list_numbered
Ranglisten
Modelldetails
Parameter: 2.4B
Länge des Eingabetokens: 10K
Eingabebildgröße: 768×28×28
Basismodell help_outline
open_in_new
Qwen2-VL-2B
open_in_new
DFN CLIP ViT
Ausgebildete Sprachen help_outline
24 Sprachen
Unterstützte Sprachen help_outline
29 Sprachen
Quantisierungen help_outline
GGUF
Ähnliche Modelle
link
jina-reranker-v2-base-multilingual
Erhältlich über
Jina-API
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-Gapped
E/A-Diagramm 1

mehrere

Text

Text

jina-reranker-m0

Ranking

E/A-Diagramm 2

mehrere

Bild

Text

jina-reranker-m0

Ranking

E/A-Diagramm 3

mehrere

Text

Bild

jina-reranker-m0

Ranking

E/A-Diagramm 4

mehrere

Bild

Bild

jina-reranker-m0

Ranking

Pareto-Front help_outline
workspace_premium
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameter (log)nDCG@5
Dieses Modell
Auf der Front
Jina AI
Andere
ViDoRe v1
91.02
Parameter
2.4B
Rang nach Score
7 / 24
Pareto-Front
Dahinter
Werteverteilunghelp_outline
AUC 0.9383
Korpus
Übersetzungspaare
Dokumentensuche
Code
Bild / Banner
Bild / Logo
0.7120.200.400.600.801.00
Verwandt83.2%
Hartes Negativ24.7%
Unverwandt9.3%
Empfohlene Schwellenwerte
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
ausgewogen · 0.692
AUC
0.9383
Rauschgrenze
0.965
Recall-Kante
0.425
Gemessene Paare
119 / 2,856
Score nach Ranghelp_outline
12345678910
Mittlerer Score je Rangposition
Was Rang 1 gewinnthelp_outline
Ein korrekter Treffer gewinnt 66 % von 119 Anfragen
Wählen Sie Modelle zum Vergleichen aus

Überblick

jina-reranker-m0 ist ein multimodaler, mehrsprachiger Reranker mit 2,4B Parametern, der auf einer Vision-Language-Modell-Architektur basiert. Es ist der erste Reranker, der visuelle Dokumente (Text, Abbildungen, Tabellen, Diagramme) in mehreren Sprachen bearbeitet, und erreicht State-of-the-Art-Leistung auf ViDoRe (91,02 NDCG-5) und beim mehrsprachigen Long-Document-Retrieval (MLDR). Das Modell unterstützt Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Mixed-Modality-Reranking.

Methoden

Das Modell basiert auf einer Decoder-Only-VLM-Architektur (2,4B Parameter), die einen DFN CLIP ViT-Vision-Encoder mit einem Qwen2-Sprachdekoder kombiniert. Im Gegensatz zu traditionellen Cross-Encodern, die nur Text verarbeiten, handhabt das VLM-Backbone nativ sowohl Text- als auch Bildeingaben und ermöglicht Reranking von Dokumenten mit visuellem Inhalt (gescannte PDFs, Infografiken, Folien, Tabellen mit eingebetteten Abbildungen). Das 10K-Token-Kontextfenster bietet Platz für bis zu 768 Token pro Bild (verarbeitet als 768×28×28-Patches). Das Training verwendet ein multimodales kontrastives Ziel über verschiedene Dokumenttypen hinweg in mehreren Sprachen. Die Decoder-Only-Architektur ermöglicht Listwise-Reranking und eröffnet Möglichkeiten für Dokumentdeduplizierung und Erklärbarkeit von Rangpunkten über Aufmerksamkeitsmechanismen — Fähigkeiten, die mit Encoder-Only-Architekturen nicht verfügbar sind.

Leistung

Beim Text-zu-Text-Reranking erzielt das Modell 58,95 NDCG-10 auf BEIR und übertrifft jina-embeddings-v3 (55,81) und bge-reranker-v2-m3 (56,51). Für mehrsprachige Inhalte erreicht es 66,75 NDCG-10 auf MIRACL (18 Sprachen). Auf dem MLDR-Benchmark für lange Dokumente erzielt es 59,83 NDCG-10 über 13 Sprachen hinweg. Code-Retrieval erreicht 63,55 NDCG-10 auf CoIR. Das Modell glänzt im visuellen Dokument-Retrieval: 91,02 NDCG-5 auf ViDoRe und 43,92 Durchschnitt auf Winoground (visio-linguistische kompositionelle Inferenz). Einige Modalitätskombinationen (z. B. Bild-zu-Bild) werden im Zero-Shot-Modus ohne spezifische Trainingsdaten unterstützt.

Anleitung

Das Modell ist über die Jina-API, AWS, Azure, GCP-Marktplätze oder lokal über Hugging Face verfügbar. Bei Nutzung der API übergeben Sie Textzeichenketten, Base64-Bilder oder Bild-URLs — neue Nutzer erhalten 10M kostenlose Token. Das Modell unterstützt bis zu 10K Eingabe-Token mit bis zu 768 Token pro Bild. Für optimale Ergebnisse erzielt das Modell die besten Leistungen bei Text-zu-Text-, Text-zu-Bild-, Bild-zu-Text- und Text-zu-Mixed-Modality-Aufgaben; Bild-zu-Bild ist zero-shot. Die Decoder-Only-Architektur ermöglicht Fähigkeiten jenseits einfachen Rerankings: Mixed-Modality-Reranking, Listwise-Reranking, Dokumentdeduplizierung und aufmerksamkeitsbasierte Ranking-Erklärbarkeit. Nutzen Sie dieses Modell, wenn Ihre Dokumente visuellen Inhalt (gescannte PDFs, Diagramme, Infografiken) enthalten, den text-only-Reranker nicht bewältigen können. Für reines Text-Reranking zu geringeren Kosten nutzen Sie jina-reranker-v3.5.

Blogs, die dieses Modell erwähnen
Oktober 03, 2025 • 7 Minuten gelesen
Jina Reranker v3: 0.6B Listwise Reranker für SOTA Multilingual Retrieval
Ein neuer Listwise-Reranker mit 0,6 Milliarden Parametern, der die Anfrage und alle Kandidatendokumente in einem einzigen Kontextfenster berücksichtigt.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
August 13, 2025 • 15 Minuten gelesen
GGUFs für Decoder-Only 向量模型 optimieren
4000 Tokens/Sekunde für ein 3B-Parameter-Vektor-Modell auf einer L4-GPU ist wahrscheinlich das Schnellste, was man mit llama.cpp erreichen kann. Oder etwa nicht?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
Juli 14, 2025 • 11 Minuten gelesen
Submodulare Optimierung für Textauswahl, Passage-Reranking & Kontext-Engineering
Während andere auf Prompt-Tuning setzen und auf das Beste hoffen, solltest du die submodulare Optimierung erlernen, die einen prinzipiellen Rahmen mit theoretischen Garantien für ein besseres Kontext-Engineering bietet.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
Juni 25, 2025 • 12 Minuten gelesen
Jina Embeddings v4: Universelle Vektor Modelle (Embeddings) für Multimodale, Mehrsprachige Suche
Jina Embeddings v4 ist ein universelles 向量模型 (Embeddings)-Modell mit 3,8 Milliarden Parametern für multimodale und mehrsprachige Suche, das sowohl Single-Vektor- als auch Multi-Vektor-Embedding-Ausgaben unterstützt.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
Mai 25, 2025 • 8 Minuten gelesen
Faires Scoring für Multimodale Dokumente mit jina-reranker-m0
Textähnlichkeit: 0.7. Bildähnlichkeit: 0.5. Welches Dokument ist relevanter? Sie können es buchstäblich nicht sagen – und das ist das Kernproblem, das die multimodale Suche behindert. Wir lösen es mit Unified Reranking (einheitlicher Reranker).
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.