Graphique d'E/S 1
Graphique d'E/S 2
Graphique d'E/S 3
Graphique d'E/S 4
Frontière de Pareto
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Paramètres (log)nDCG@5
Ce modèle
Sur la frontière
Jina AI
Autres
ViDoRe v1
91.02
Paramètres
2.4B
Rang par score
7 / 24
Frontière de Pareto
Derrière
Distribution des valeurs
AUC 0.9383
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
0.7120.200.400.600.801.00
Liées83.2%
Négatif difficile24.7%
Non liées9.3%
Seuils recommandés
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
équilibré · 0.692
AUC
0.9383
Plafond de bruit
0.965
Décrochage du rappel
0.425
Paires mesurées
119 / 2 856
Score par rang
12345678910
Score moyen à chaque position de rang
Ce qui gagne le rang 1
Une correspondance correcte gagne 66 % des 119 requêtes
Choisissez les modèles à comparer

Aperçu

jina-reranker-m0 est un reranker multimodal multilingue de 2,4B paramètres basé sur une architecture de modèle de vision-langage. C'est le premier reranker à traiter des documents visuels (texte, figures, tableaux, graphiques) dans plusieurs langues, atteignant des performances state-of-the-art sur ViDoRe (91,02 NDCG-5) et sur la récupération de documents longs multilingue (MLDR). Le modèle prend en charge le reranking texte-vers-texte, texte-vers-image, image-vers-texte et multimodalité mixte.

Méthodes

Le modèle est construit sur une architecture VLM decoder-only (2,4B paramètres) combinant un vision encoder DFN CLIP ViT avec un décodeur de langage Qwen2. Contrairement aux cross-encodeurs traditionnels qui ne traitent que du texte, le backbone VLM gère nativement à la fois les entrées texte et image, permettant le reranking de documents contenant du contenu visuel (PDF scannés, infographies, présentations, tableaux avec figures intégrées). La fenêtre de contexte de 10K tokens accueille jusqu'à 768 tokens par image (traitées en patches 768×28×28). L'entraînement utilise un objectif contrastif multimodal sur divers types de documents dans plusieurs langues. L'architecture decoder-only permet le reranking listwise et ouvre des possibilités de déduplication de documents et d'explicabilité des scores de classement via les mécanismes d'attention — des capacités indisponibles avec des architectures encoder-only.

Performance

En reranking texte-vers-texte, le modèle obtient 58,95 NDCG-10 sur BEIR, surpassant jina-embeddings-v3 (55,81) et bge-reranker-v2-m3 (56,51). Pour le contenu multilingue, il atteint 66,75 NDCG-10 sur MIRACL (18 langues). Sur le benchmark MLDR pour documents longs, il obtient 59,83 NDCG-10 sur 13 langues. La récupération de code atteint 63,55 NDCG-10 sur CoIR. Le modèle brille en récupération de documents visuels : 91,02 NDCG-5 sur ViDoRe et 43,92 de moyenne sur Winoground (raisonnement compositionnel visio-linguistique). Certaines combinaisons de modalités (p. ex. image-vers-image) sont prises en charge en mode zero-shot sans données d'entraînement spécifiques.

Conseils

Le modèle est accessible via l'API Jina, les marketplaces AWS, Azure et GCP, ou localement via Hugging Face. Lors de l'utilisation de l'API, passez des chaînes de texte, des images base64 ou des URL d'images — les nouveaux utilisateurs reçoivent 10M de tokens gratuits. Le modèle prend en charge jusqu'à 10K tokens d'entrée avec jusqu'à 768 tokens par image. Pour des résultats optimaux, le modèle fonctionne le mieux sur les tâches texte-vers-texte, texte-vers-image, image-vers-texte et texte-vers-modalité mixte ; image-vers-image est zero-shot. L'architecture decoder-only permet des capacités au-delà du reranking simple : reranking multimodal mixte, reranking listwise, déduplication de documents et explicabilité du classement basée sur l'attention. Utilisez ce modèle lorsque vos documents contiennent du contenu visuel (PDF scannés, graphiques, infographies) que les rerankers texte seul ne peuvent pas traiter. Pour du reranking de texte pur à moindre coût, utilisez jina-reranker-v3.5.

Blogs qui mentionnent ce modèle
octobre 03, 2025 • 7 minutes lues
Jina Reranker v3 : 重排器 Listwise de 0,6B pour une récupération multilingue SOTA
Nouveau réorganisateur listwise de 0,6 milliard de paramètres qui prend en compte la requête et tous les documents candidats dans une seule fenêtre contextuelle.
août 13, 2025 • 15 minutes lues
Optimisation des GGUF pour les modèles de 向量模型 à décodeur uniquement
4000词元/秒 pour un modèle de 向量模型 de 3 milliards de paramètres sur GPU L4 est probablement la vitesse maximale que vous obtiendrez avec llama.cpp. Ou pas ?
juillet 14, 2025 • 11 minutes lues
Optimisation sous-modulaire pour la sélection de texte, le réclassement de passages et l'ingénierie contextuelle
Alors que d'autres comptent sur l'ajustement des invites et espèrent le meilleur, vous devriez apprendre l'optimisation sous-modulaire, qui fournit un cadre théorique avec des garanties théoriques pour une meilleure ingénierie du contexte.
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4 : Vecteurs universels pour la recherche multimodale et multilingue
Jina Embeddings v4 est un modèle d'向量模型 (Embeddings) universel de 3,8 milliards de paramètres pour la recherche multimodale et multilingue qui prend en charge les sorties d'向量模型 (Embeddings) à vecteur unique et à vecteurs multiples.
mai 25, 2025 • 8 minutes lues
Notation équitable pour les documents multimodaux avec jina-reranker-m0
Similarité textuelle : 0,7. Similarité d’image : 0,5. Quel document est le plus pertinent ? Impossible de le dire, et c’est là le problème fondamental qui entrave la recherche multimodale. Nous le résolvons avec le réordonnancement unifié (unified reranking).