Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Reclasseur
copyright CC BY-NC 4.0
open_in_new Publication de publication

jina-reranker-m0

Modèle de reclassement multimodal multilingue pour le classement des documents visuels
Licence
copyright CC-BY-NC-4.0
Date de sortie
calendar_month
2025-04-08
Saisir
abc
Texte (requête)
image
Image (requête)
abc
Texte (Document)
image
Image (Document)
arrow_forward
Sortir
format_list_numbered
Classements
Détails du modèle
Paramètres: 2.4B
Longueur du jeton d'entrée: 10K
Taille de l'image d'entrée: 768×28×28
Modèle de base help_outline
open_in_new
Qwen2-VL-2B
Langues enseignées help_outline
24 langues
Langues prises en charge help_outline
29 langues
Quantifications help_outline
GGUF
Modèles associés
link
jina-reranker-v2-base-multilingual
Disponible via
API Jina
AWS SageMaker
Microsoft Azure
Google Cloud
Hugging Face
Air-gapped
Graphique d'E/S 1

multiple

Texte

Texte

jina-reranker-m0

Classement

Graphique d'E/S 2

multiple

Image

Texte

jina-reranker-m0

Classement

Graphique d'E/S 3

multiple

Texte

Image

jina-reranker-m0

Classement

Graphique d'E/S 4

multiple

Image

Image

jina-reranker-m0

Classement

Pareto fronthelp_outline
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameters (log)nDCG@5
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Distribution des valeurshelp_outline
AUC 0.9383
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
0.7120.200.400.600.801.00
Liées83.2%
Négatif difficile24.7%
Non liées9.3%
Seuils recommandés
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
équilibré · 0.692
AUC
0.9383
Plafond de bruit
0.965
Décrochage du rappel
0.425
Paires mesurées
119 / 2,856
Score par ranghelp_outline
12345678910
Score moyen à chaque position de rang
Ce qui gagne le rang 1help_outline
Une correspondance correcte gagne 66 % des 119 requêtes
Choisissez les modèles à comparer

Aperçu

jina-reranker-m0 est un modèle de reranker multimodal et multilingue révolutionnaire, conçu pour classer les documents visuels dans plusieurs langues. Ce modèle se distingue par sa capacité à traiter des requêtes avec des images de documents visuellement riches (pages contenant du texte, figures, tableaux et diverses mises en page) dans 29 langues. Le modèle génère une liste de documents classés par pertinence par rapport à la requête d'entrée. Contrairement aux rerankers précédents, confrontés au problème de « l'écart de modalité » (images regroupées à proximité d'autres images et texte regroupé à proximité de texte), jina-reranker-m0 unifie les modalités textuelles et visuelles dans un seul modèle, exclusivement dédié au décodeur, créant ainsi une expérience de recherche multimodale fluide, capable de classer efficacement les images et les documents texte.

Méthodes

L'architecture de jina-reranker-m0 marque une rupture significative avec les approches précédentes. Basée sur Qwen2-VL-2B et ses 2,4 milliards de paramètres, elle abandonne l'architecture classique à encodeurs croisés au profit d'un modèle de langage visuel composé uniquement de décodeurs. Le système exploite l'encodeur et le projecteur visuels pré-entraînés de Qwen2-VL, affine son modèle de langage grâce à LoRA (Low-Rank Adaptation) et utilise un MLP post-entraîné pour générer des logits de classement mesurant la pertinence entre la requête et le document. Ce modèle discriminatif peut traiter jusqu'à 32 000 tokens et prend en charge des images de 56 × 56 pixels jusqu'à une résolution de 4K. Lors du traitement d'images, le Vision Transformer (ViT) et le projecteur condensent les tokens adjacents de 2 × 2 tokens en tokens visuels uniques, tandis que des tokens spéciaux marquent clairement les frontières entre tokens visuels, permettant ainsi au modèle de langage d'intégrer et de raisonner correctement sur les éléments visuels et textuels.

Performance

Jina-reranker-m0 obtient des résultats impressionnants sur plusieurs benchmarks. En reranking texte-à-texte, il obtient un score de 58,95 NDCG-10 au benchmark BEIR, surpassant ainsi des concurrents comme jina-embeddings-v3 (55,81) et bge-reranker-v2-m3 (56,51). Pour le contenu multilingue, il obtient un score de 66,75 NDCG-10 au benchmark MIRACL couvrant 18 langues. Au benchmark MLDR pour les documents longs, il obtient un score de 59,83 NDCG-10 sur 13 langues. Pour la recherche de code au benchmark CoIR, il obtient un score de 63,55 NDCG-10, surpassant largement ses concurrents. Mais le modèle brille vraiment dans la recherche de documents visuels : sur le benchmark ViDoRe, il obtient un score impressionnant de 91,02 NDCG-5, tandis que sur Winoground, qui teste le raisonnement compositionnel visio-linguistique, il obtient un score moyen de 43,92, démontrant sa capacité supérieure à comprendre les relations entre le texte et les images par rapport aux autres modèles.

Conseils

Pour maximiser le potentiel de jina-reranker-m0, les développeurs doivent envisager plusieurs stratégies d'implémentation. Le modèle est accessible via une API, des marketplaces de services cloud (AWS, Azure, GCP) ou localement via Hugging Face. Grâce à l'API, les développeurs peuvent transmettre des chaînes de texte, des images base64 ou des URL d'images, et les nouveaux utilisateurs peuvent bénéficier de dix millions de tokens gratuits. Bien que le modèle soit exceptionnellement performant sur les tâches texte-à-texte, texte-à-image, image-à-texte et texte-vers-unimodal-mixte grâce à un entraînement intensif, il est important de noter que certaines combinaisons (comme image-à-image) sont prises en charge en mode zero-shot, sans entraînement spécifique. Pour des résultats optimaux, rappelez-vous que le modèle prend en charge jusqu'à 10K tokens d'entrée, avec un maximum de 768 tokens par image. L'approche décodeur uniquement de l'architecture ouvre des possibilités au-delà du simple reranking, y compris le véritable reranking à modalités mixtes, le reranking listwise, la déduplication des documents et l'explicabilité des scores de classement via des mécanismes d'attention, des capacités qui n'étaient pas réalisables avec les architectures précédentes basées uniquement sur l'encodeur.
Blogs qui mentionnent ce modèle
octobre 03, 2025 • 7 minutes lues
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
août 13, 2025 • 15 minutes lues
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
juillet 14, 2025 • 11 minutes lues
Submodular Optimization for Text Selection, Passage Reranking & Context Engineering
While others rely on prompt tuning and hope for the best, you should learn submodular optimization that provides a principled framework with theoretical guarantees for better context engineering.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
mai 25, 2025 • 8 minutes lues
Fair Scoring for Multimodal Documents with jina-reranker-m0
Text similarity: 0.7. Image similarity: 0.5. Which document is more relevant? You literally cannot tell—and that's the core problem breaking multimodal search. We solve it with unified reranking.
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.