Aperçu
jina-reranker-m0 est un reranker multimodal multilingue de 2,4B paramètres basé sur une architecture de modèle de vision-langage. C'est le premier reranker à traiter des documents visuels (texte, figures, tableaux, graphiques) dans plusieurs langues, atteignant des performances state-of-the-art sur ViDoRe (91,02 NDCG-5) et sur la récupération de documents longs multilingue (MLDR). Le modèle prend en charge le reranking texte-vers-texte, texte-vers-image, image-vers-texte et multimodalité mixte.
Méthodes
Le modèle est construit sur une architecture VLM decoder-only (2,4B paramètres) combinant un vision encoder DFN CLIP ViT avec un décodeur de langage Qwen2. Contrairement aux cross-encodeurs traditionnels qui ne traitent que du texte, le backbone VLM gère nativement à la fois les entrées texte et image, permettant le reranking de documents contenant du contenu visuel (PDF scannés, infographies, présentations, tableaux avec figures intégrées). La fenêtre de contexte de 10K tokens accueille jusqu'à 768 tokens par image (traitées en patches 768×28×28). L'entraînement utilise un objectif contrastif multimodal sur divers types de documents dans plusieurs langues. L'architecture decoder-only permet le reranking listwise et ouvre des possibilités de déduplication de documents et d'explicabilité des scores de classement via les mécanismes d'attention — des capacités indisponibles avec des architectures encoder-only.
Performance
En reranking texte-vers-texte, le modèle obtient 58,95 NDCG-10 sur BEIR, surpassant jina-embeddings-v3 (55,81) et bge-reranker-v2-m3 (56,51). Pour le contenu multilingue, il atteint 66,75 NDCG-10 sur MIRACL (18 langues). Sur le benchmark MLDR pour documents longs, il obtient 59,83 NDCG-10 sur 13 langues. La récupération de code atteint 63,55 NDCG-10 sur CoIR. Le modèle brille en récupération de documents visuels : 91,02 NDCG-5 sur ViDoRe et 43,92 de moyenne sur Winoground (raisonnement compositionnel visio-linguistique). Certaines combinaisons de modalités (p. ex. image-vers-image) sont prises en charge en mode zero-shot sans données d'entraînement spécifiques.
Conseils
Le modèle est accessible via l'API Jina, les marketplaces AWS, Azure et GCP, ou localement via Hugging Face. Lors de l'utilisation de l'API, passez des chaînes de texte, des images base64 ou des URL d'images — les nouveaux utilisateurs reçoivent 10M de tokens gratuits. Le modèle prend en charge jusqu'à 10K tokens d'entrée avec jusqu'à 768 tokens par image. Pour des résultats optimaux, le modèle fonctionne le mieux sur les tâches texte-vers-texte, texte-vers-image, image-vers-texte et texte-vers-modalité mixte ; image-vers-image est zero-shot. L'architecture decoder-only permet des capacités au-delà du reranking simple : reranking multimodal mixte, reranking listwise, déduplication de documents et explicabilité du classement basée sur l'attention. Utilisez ce modèle lorsque vos documents contiennent du contenu visuel (PDF scannés, graphiques, infographies) que les rerankers texte seul ne peuvent pas traiter. Pour du reranking de texte pur à moindre coût, utilisez jina-reranker-v3.5.








