Graphique d'E/S 1
Graphique d'E/S 2
Graphique d'E/S 3
Graphique d'E/S 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Distribution des valeurshelp_outlineAUC 0.9383
Corpus
Paires de traduction
Recherche documentaire
Code
Image / bannière
Image / logo
Liées83.2%
Négatif difficile24.7%
Non liées9.3%
Seuils recommandés
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
équilibré · 0.692
AUC
0.9383
Plafond de bruit
0.965
Décrochage du rappel
0.425
Paires mesurées
119 / 2,856
Score par ranghelp_outline
Score moyen à chaque position de rang
Ce qui gagne le rang 1help_outline
Une correspondance correcte gagne 66 % des 119 requêtes
Choisissez les modèles à comparer
Aperçu
jina-reranker-m0 est un modèle de reranker multimodal et multilingue révolutionnaire, conçu pour classer les documents visuels dans plusieurs langues. Ce modèle se distingue par sa capacité à traiter des requêtes avec des images de documents visuellement riches (pages contenant du texte, figures, tableaux et diverses mises en page) dans 29 langues. Le modèle génère une liste de documents classés par pertinence par rapport à la requête d'entrée. Contrairement aux rerankers précédents, confrontés au problème de « l'écart de modalité » (images regroupées à proximité d'autres images et texte regroupé à proximité de texte), jina-reranker-m0 unifie les modalités textuelles et visuelles dans un seul modèle, exclusivement dédié au décodeur, créant ainsi une expérience de recherche multimodale fluide, capable de classer efficacement les images et les documents texte.
Méthodes
L'architecture de jina-reranker-m0 marque une rupture significative avec les approches précédentes. Basée sur Qwen2-VL-2B et ses 2,4 milliards de paramètres, elle abandonne l'architecture classique à encodeurs croisés au profit d'un modèle de langage visuel composé uniquement de décodeurs. Le système exploite l'encodeur et le projecteur visuels pré-entraînés de Qwen2-VL, affine son modèle de langage grâce à LoRA (Low-Rank Adaptation) et utilise un MLP post-entraîné pour générer des logits de classement mesurant la pertinence entre la requête et le document. Ce modèle discriminatif peut traiter jusqu'à 32 000 tokens et prend en charge des images de 56 × 56 pixels jusqu'à une résolution de 4K. Lors du traitement d'images, le Vision Transformer (ViT) et le projecteur condensent les tokens adjacents de 2 × 2 tokens en tokens visuels uniques, tandis que des tokens spéciaux marquent clairement les frontières entre tokens visuels, permettant ainsi au modèle de langage d'intégrer et de raisonner correctement sur les éléments visuels et textuels.
Performance
Jina-reranker-m0 obtient des résultats impressionnants sur plusieurs benchmarks. En reranking texte-à-texte, il obtient un score de 58,95 NDCG-10 au benchmark BEIR, surpassant ainsi des concurrents comme jina-embeddings-v3 (55,81) et bge-reranker-v2-m3 (56,51). Pour le contenu multilingue, il obtient un score de 66,75 NDCG-10 au benchmark MIRACL couvrant 18 langues. Au benchmark MLDR pour les documents longs, il obtient un score de 59,83 NDCG-10 sur 13 langues. Pour la recherche de code au benchmark CoIR, il obtient un score de 63,55 NDCG-10, surpassant largement ses concurrents. Mais le modèle brille vraiment dans la recherche de documents visuels : sur le benchmark ViDoRe, il obtient un score impressionnant de 91,02 NDCG-5, tandis que sur Winoground, qui teste le raisonnement compositionnel visio-linguistique, il obtient un score moyen de 43,92, démontrant sa capacité supérieure à comprendre les relations entre le texte et les images par rapport aux autres modèles.
Conseils
Pour maximiser le potentiel de jina-reranker-m0, les développeurs doivent envisager plusieurs stratégies d'implémentation. Le modèle est accessible via une API, des marketplaces de services cloud (AWS, Azure, GCP) ou localement via Hugging Face. Grâce à l'API, les développeurs peuvent transmettre des chaînes de texte, des images base64 ou des URL d'images, et les nouveaux utilisateurs peuvent bénéficier de dix millions de tokens gratuits. Bien que le modèle soit exceptionnellement performant sur les tâches texte-à-texte, texte-à-image, image-à-texte et texte-vers-unimodal-mixte grâce à un entraînement intensif, il est important de noter que certaines combinaisons (comme image-à-image) sont prises en charge en mode zero-shot, sans entraînement spécifique. Pour des résultats optimaux, rappelez-vous que le modèle prend en charge jusqu'à 10K tokens d'entrée, avec un maximum de 768 tokens par image. L'approche décodeur uniquement de l'architecture ouvre des possibilités au-delà du simple reranking, y compris le véritable reranking à modalités mixtes, le reranking listwise, la déduplication des documents et l'explicabilité des scores de classement via des mécanismes d'attention, des capacités qui n'étaient pas réalisables avec les architectures précédentes basées uniquement sur l'encodeur.
Blogs qui mentionnent ce modèle








