Aujourd'hui, nous publions jina-reranker-m0, notre nouveau modèle de réorganisation multilingue et multimodal pour le classement de documents visuels dans plusieurs langues : il accepte une requête ainsi qu'une collection d'images de documents riches en contenu visuel, y compris des pages contenant du texte, des figures, des tableaux, des infographies et diverses mises en page dans de multiples domaines et plus de 29 langues. Il produit une liste classée de documents ordonnés selon leur pertinence par rapport à la requête d'entrée. Par rapport à jina-reranker-v2-base-multilingual, jina-reranker-m0 améliore également le reclassement de texte pour le contenu multilingue, les longs documents et les tâches de recherche de code.


tagNouvelle Architecture
Contrairement à jina-reranker-v2-base-multilingual, jina-reranker-m0 passe de l'architecture classique cross-encoder à un modèle de langage visuel decoder-only. Il utilise l'encodeur et le projecteur de vision préentraînés de Qwen2-VL, a affiné son LLM avec LoRA, et a post-entraîné un MLP pour générer des logits de classement qui mesurent la pertinence requête-document. Cela donne un modèle discriminatif optimisé pour les tâches de classement.
| jina-reranker-m0 | jina-reranker-v2 |
|
|---|---|---|
| Architecture | Vision Language Model | Cross-Encoder |
| Base model | Qwen2-VL-2B | Jina-XLM-RoBERTa |
| Parameters | 2.4 B | 278 M |
| Max context length (query + document) | 10,240 | 8,192 |
| Max image patches (dynamic resolution) | 768 × 28 × 28 | ❌ |
| Multilingual support | ✅ | ✅ |
| Tasks supported | Text2Text, Text2Image, Image2Text, Text2Mixed | Text2Text |
Cette nouvelle architecture permet à jina-reranker-m0 de gérer jusqu'à 32K tokens, combinant harmonieusement les entrées visuelles et textuelles. Le modèle prend en charge des images allant d'une taille minimale de 56×56 pixels jusqu'à une résolution 4K. Lors du traitement des images, le ViT et le projecteur condensent les tokens adjacents 2×2 en tokens visuels uniques pour l'entrée du LLM. Des tokens spéciaux comme <|vision_start|> et <|vision_end|> marquent clairement les limites des tokens visuels, permettant au modèle de langage de traiter correctement les informations visuelles et d'effectuer un raisonnement multimodal sophistiqué qui intègre à la fois les éléments visuels et textuels.
Cette architecture résout également efficacement le problème d'écart entre modalités qui affectait les modèles précédents comme jina-clip-v1 et jina-clip-v2. Auparavant, les images se regroupaient près d'autres images tandis que le texte se regroupait près d'autre texte dans l'espace de représentation, créant une déconnexion. Cela signifiait que lorsque vos documents candidats contenaient à la fois des images et du texte, la recherche d'images à l'aide de requêtes textuelles était problématique. Avec jina-reranker-m0, vous pouvez désormais classer les images et les documents ensemble sans vous soucier de cet écart, créant une expérience de recherche multimodale véritablement unifiée.
Il convient de noter que notre entraînement était limité à un maximum de 10K tokens d'entrée, avec jusqu'à 768 tokens par image (entre les marqueurs <|vision_start|> et <|vision_end|>). De plus, nous n'avons pas spécifiquement entraîné le modèle pour les tâches de reclassement image-to-image, image-to-multimodal, ou text-to-multimodal. Dans ce contexte, "multimodal" fait référence à un document unique contenant à la fois des tokens d'image et de texte en entrée. En examinant toutes les combinaisons possibles de tokens d'image et de texte dans les requêtes et les documents, nous pouvons résumer la gamme complète des tâches prises en charge par jina-reranker-m0 dans le tableau ci-dessous.

Dans nos tests, nous avons trouvé des indices suggérant que le modèle peut extrapoler à ces tâches de classement non entraînées, mais toute efficacité dans ces domaines doit être considérée comme le résultat de la transférabilité zero-shot du modèle ou d'effets secondaires non intentionnels de l'entraînement. Nous n'avons pas effectué d'évaluations sérieuses des performances du modèle sur ces tâches, et prévoyons d'explorer ces capacités plus en profondeur dans de futures recherches.
tagPour Commencer
tagVia API
Le code ci-dessous montre comment calculer les scores de pertinence entre la requête "small language model data extraction" et une collection d'images et de documents textuels. Vous pouvez passer une chaîne de texte, une image encodée en base64 ou une URL d'image. Les nouveaux utilisateurs peuvent obtenir une clé API Jina avec 1 million de tokens gratuits. Bien que notre API ne prenne pas en charge l'utilisation d'images comme requêtes, vous pouvez utiliser des images comme requêtes lors de l'accès au modèle via la bibliothèque Hugging Face Transformers.
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer JINA_API_KEY" \
-d '{
"model": "jina-reranker-m0",
"query": "small language model data extraction",
"documents": [
{
"image": "https://raw.githubusercontent.com/jina-ai/multimodal-reranker-test/main/handelsblatt-preview.png"
},
{
"image": "https://raw.githubusercontent.com/jina-ai/multimodal-reranker-test/main/paper-11.png"
},
{
"image": "https://raw.githubusercontent.com/jina-ai/multimodal-reranker-test/main/wired-preview.png"
},
{
"text": "We present ReaderLM-v2, a compact 1.5 billion parameter language model designed for efficient web content extraction. Our model processes documents up to 512K tokens, transforming messy HTML into clean Markdown or JSON formats with high accuracy -- making it an ideal tool for grounding large language models. The models effectiveness results from two key innovations: (1) a three-stage data synthesis pipeline that generates high quality, diverse training data by iteratively drafting, refining, and critiquing web content extraction; and (2) a unified training framework combining continuous pre-training with multi-objective optimization. Intensive evaluation demonstrates that ReaderLM-v2 outperforms GPT-4o-2024-08-06 and other larger models by 15-20% on carefully curated benchmarks, particularly excelling at documents exceeding 100K tokens, while maintaining significantly lower computational requirements."
},
{
"image": "https://jina.ai/blog-banner/using-deepseek-r1-reasoning-model-in-deepsearch.webp"
},
{
"text": "数据提取么?为什么不用正则啊,你用正则不就全解决了么?"
},
{
"text": "During the California Gold Rush, some merchants made more money selling supplies to miners than the miners made finding gold."
},
{
"text": "Die wichtigsten Beiträge unserer Arbeit sind zweifach: Erstens führen wir eine neuartige dreistufige Datensynthese-Pipeline namens Draft-Refine-Critique ein, die durch iterative Verfeinerung hochwertige Trainingsdaten generiert; und zweitens schlagen wir eine umfassende Trainingsstrategie vor, die kontinuierliches Vortraining zur Längenerweiterung, überwachtes Feintuning mit spezialisierten Kontrollpunkten, direkte Präferenzoptimierung (DPO) und iteratives Self-Play-Tuning kombiniert. Um die weitere Forschung und Anwendung der strukturierten Inhaltsextraktion zu erleichtern, ist das Modell auf Hugging Face öffentlich verfügbar."
}
],
"return_documents": false
}'La réponse est affichée ci-dessous, où le premier résultat index=1 correspond à notre capture d'écran du papier ReaderLM-v2 paper screenshot.
{"model":"jina-reranker-m0","usage":{"total_tokens":2829},"results":[{"index":1,"relevance_score":0.9587112551898949},{"index":3,"relevance_score":0.9337408271911014},{"index":7,"relevance_score":0.8922925217195924},{"index":2,"relevance_score":0.8891905997562045},{"index":0,"relevance_score":0.8827516945848907},{"index":4,"relevance_score":0.8701035914834407},{"index":6,"relevance_score":0.8676828987527296},{"index":5,"relevance_score":0.8455347349164652}]}tagVia les Places de Marché CSP
jina-reranker-m0 sera bientôt disponible directement sur AWS, Azure et GCP aux prix indiqués.
tagVia HuggingFace
Vous pouvez également utiliser le modèle localement depuis notre page Hugging Face. Nous avons préparé un notebook Google Colab qui démontre son fonctionnement. Par rapport à notre API web, l'utilisation locale du modèle offre une plus grande flexibilité, comme la possibilité d'utiliser des images comme requêtes et de travailler avec des documents multimodaux.

tagÉvaluation
Les évaluations complètes sont disponibles dans ce Google Spreadsheet.
tagBEIR (Texte2Texte, Anglais uniquement)

BEIR est un référentiel hétérogène pour la recherche d'informations, conçu pour évaluer la polyvalence et la robustesse des modèles IR. Il contient un ensemble diversifié de jeux de données provenant de différents domaines et se concentre sur l'évaluation zero-shot. Des métriques d'évaluation standardisées telles que NDCG, Recall@K et MRR sont utilisées.
| Model | AVG (NDCG@10) | TREC-COVID | NFCorpus | NQ | HotpotQA | FiQA | ArguAna | Touche-2020 | DBPedia | SCIDOCS | FEVER | Climate-FEVER | SciFact | Quora |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| jina-reranker-m0 | 58.95 | 84.17 | 41.03 | 72.25 | 76.99 | 51.62 | 40.69 | 31.79 | 49.34 | 22.91 | 91.14 | 36.42 | 79.94 | 88.01 |
| jina-embeddings-v3 (1024 tokens) | 55.81 | 77.81 | 36.65 | 64.31 | 64.63 | 47.47 | 54.31 | 26.55 | 41.07 | 19.91 | 89.00 | 42.33 | 72.4 | 89.06 |
| bge-reranker-v2-m3 | 56.51 | 82.19 | 34.33 | 69.52 | 77.89 | 45.45 | 36.21 | 33.12 | 46.72 | 17.79 | 91.03 | 38.69 | 72.64 | 89.10 |
| jina-reranker-v2-multilingual | 57.06 | 80.53 | 37.17 | 67.39 | 76.17 | 46.48 | 39.28 | 32.35 | 47.81 | 20.03 | 93.02 | 37.17 | 76.50 | 87.83 |
tagMIRACL (Text2Text, Multilingue, 18 langues)

MIRACL est un large jeu de données multilingue pour la recherche d'informations ad hoc couvrant 18 langues. Il englobe plus de trois milliards de locuteurs natifs et comprend des annotations humaines approfondies. L'accent est mis sur les tâches de recherche monolingue.
| Model | AVG (NDCG@10) | ar | bn | en | es | fa | fi | fr | hi | id | ja | ko | ru | sw | te | th | zh | de | yo |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| jina-reranker-m0 | 66.75 | 79.78 | 78.01 | 59.21 | 53.56 | 58.80 | 78.00 | 56.66 | 62.83 | 54.92 | 66.51 | 72.86 | 67.26 | 59.04 | 70.19 | 80.37 | 64.51 | 58.50 | 80.44 |
| jina-embeddings-v3 (8192 tokens) | 58.90 | 71.53 | 69.86 | 48.37 | 46.91 | 54.13 | 71.15 | 50.90 | 55.05 | 47.83 | 56.46 | 64.76 | 55.63 | 54.07 | 70.48 | 73.56 | 55.29 | 49.18 | 65.01 |
| bge-reranker-v2-m3 | 69.32 | 80.51 | 81.85 | 57.67 | 57.64 | 61.92 | 80.38 | 59.60 | 67.66 | 58.86 | 67.37 | 75.14 | 67.61 | 68.92 | 76.69 | 82.29 | 64.46 | 58.32 | 80.85 |
| jina-reranker-v2-multilingual | 63.65 | 72.50 | 79.42 | 46.66 | 51.54 | 57.81 | 73.05 | 50.90 | 60.94 | 56.66 | 59.15 | 72.60 | 53.43 | 66.47 | 74.62 | 77.75 | 62.49 | 53.06 | 76.69 |
tagMLDR (Text2Text, Documents longs multilingues, 13 langues)

MLDR est un jeu de données multilingue spécialement conçu pour la recherche de documents longs, couvrant 13 langues. Il utilise GPT-3.5 pour générer des questions pour les documents. Le jeu de données est construit à partir de Wikipedia, Wudao et mC4.
| Model | AVG (NDCG@10) | ar | de | en | es | fr | hi | it | ja | ko | pt | ru | th | zh |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| jina-reranker-m0 | 59.83 | 55.86 | 51.25 | 54.67 | 87.63 | 82.59 | 32.76 | 73.25 | 58.93 | 55.73 | 86.08 | 66.73 | 39.17 | 33.14 |
| jina-embeddings-v3 (8192 tokens) | 39.71 | 28.44 | 31.57 | 29.07 | 62.08 | 59.79 | 25.47 | 53.72 | 38.36 | 32.37 | 63.26 | 49.65 | 25.15 | 17.26 |
| bge-reranker-v2-m3 | 53.53 | 49.19 | 45.39 | 43.92 | 74.57 | 68.67 | 44.75 | 62.79 | 49.27 | 48.24 | 76.45 | 62.84 | 38.82 | 31.02 |
| jina-reranker-v2-multilingual | 59.50 | 51.96 | 50.13 | 46.85 | 86.34 | 82.25 | 49.50 | 69.00 | 59.07 | 52.19 | 85.26 | 68.06 | 38.73 | 34.15 |
tagMKQA (Text2Text, Question-Réponse Multilingue, 24 langues, 3 variantes pour le chinois)

MKQA est un ensemble d'évaluation de questions-réponses en domaine ouvert comprenant 10 000 paires de questions-réponses alignées sur 26 langues typologiquement diverses. Les paires de questions-réponses sont échantillonnées à partir de Google Natural Questions.
| Model | AVG (recall@10) | ar | da | de | es | en | fi | fr | he | hu | it | ja | km | ko | ms | nl | no | pl | pt | ru | sv | th | tr | vi | zh_cn | zh_hk | zh_tw |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| jina-reranker-m0 | 68.19 | 63.88 | 70.57 | 70.52 | 71.26 | 73.47 | 64.10 | 71.11 | 63.68 | 63.23 | 70.30 | 69.13 | 50.43 | 64.30 | 70.78 | 71.73 | 70.25 | 69.72 | 70.57 | 70.78 | 70.69 | 69.80 | 67.90 | 69.68 | 69.12 | 68.23 | 67.79 |
| jina-embeddings-v3 (8192 tokens) | 65.63 | 59.00 | 69.12 | 68.27 | 68.15 | 71.14 | 65.66 | 68.30 | 59.51 | 63.23 | 68.30 | 64.36 | 56.13 | 58.98 | 68.30 | 69.53 | 68.65 | 67.26 | 67.93 | 67.06 | 68.68 | 66.32 | 66.97 | 66.87 | 63.38 | 63.59 | 61.55 |
| bge-reranker-v2-m3 | 67.88 | 63.09 | 70.15 | 68.91 | 68.92 | 73.00 | 68.71 | 68.71 | 70.27 | 64.00 | 68.15 | 68.47 | 60.43 | 63.95 | 68.80 | 70.77 | 69.10 | 67.44 | 67.40 | 69.77 | 70.03 | 69.68 | 66.04 | 68.29 | 67.84 | 66.70 | 66.34 |
| jina-reranker-v2-multilingual | 67.90 | 63.88 | 70.31 | 70.09 | 70.51 | 73.09 | 67.50 | 70.38 | 63.00 | 64.59 | 69.90 | 67.34 | 57.79 | 62.14 | 70.36 | 71.58 | 69.51 | 68.61 | 70.13 | 70.07 | 70.15 | 68.80 | 68.02 | 69.39 | 67.23 | 65.77 | 65.37 |
tagCoIR (Text2Text, Recherche d'Information dans le Code)

CoIR est un benchmark complet conçu pour évaluer les capacités des modèles en matière de recherche de code. Il comprend 10 jeux de données de code couvrant 8 tâches de recherche dans 7 domaines différents. Un framework Python est fourni pour ce benchmark.
| Model Name | Avg (NDCG@10) | Text-to-Code | Code-to-Text | Code-to-Code | Hybrid Code | ||||||||||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Apps | CosQA | SQL | CSN | CSN-CCR | CodeTransOcean | StackOver Flow |
CodeFeedBack | ||||||||||||||||
| AVG | python | javascript | go | ruby | java | php | AVG | python | javascript | go | ruby | java | php | -Contest | -DL | -MT | -ST | ||||||
| jina-reranker-m0 | 63.55 | 26.21 | 37.75 | 57.92 | 80.76 | 98.37 | 71.16 | 86.14 | 72.74 | 79.02 | 77.14 | 74.57 | 81.66 | 77.92 | 68.71 | 75.44 | 77.54 | 66.13 | 79.79 | 31.89 | 90.41 | 72.25 | 83.95 |
| jina-embeddings-v2-base-code (top 100) |
56.90 | 16.34 | 41.72 | 49.79 | 83.95 | 94.71 | 76.35 | 87.39 | 78.23 | 82.69 | 84.35 | 59.65 | 68.23 | 62.31 | 49.15 | 65.40 | 63.89 | 48.92 | 79.20 | 30.35 | 89.42 | 49.62 | 68.93 |
| bge-reranker-v2-m3 | 35.97 | 8.33 | 30.06 | 50.63 | 49.26 | 67.62 | 39.55 | 58.11 | 41.37 | 44.77 | 44.13 | 40.81 | 42.57 | 42.75 | 38.04 | 38.04 | 41.73 | 41.73 | 34.93 | 5.09 | 60.12 | 16.44 | 64.05 |
| jina-reranker-v2-multilingual | 56.14 | 21.90 | 37.26 | 53.56 | 78.88 | 97.83 | 67.43 | 84.64 | 68.93 | 75.73 | 78.71 | 63.59 | 72.62 | 67.80 | 55.07 | 67.25 | 64.25 | 54.54 | 73.67 | 25.74 | 91.24 | 42.03 | 73.59 |
tagViDoRe (Benchmark de recherche de documents visuels Text2Image)

ViDoRe est un benchmark conçu pour évaluer la capacité des systèmes de recherche à faire correspondre des requêtes avec des documents pertinents en utilisant des caractéristiques visuelles. Il couvre diverses tâches de recherche au niveau de la page dans plusieurs domaines et langues. Le benchmark se concentre sur les éléments visuels des documents.
| Model Name | AVG (NDCG@5) |
TAT-DQA | Shift Project |
Artificial Intelligence |
Government Reports |
ArxivQA | DocVQA | Healthcare Industry |
InfoVQA | Energy | TabFQuad |
|---|---|---|---|---|---|---|---|---|---|---|---|
| jina-reranker-m0 | 91.02 | 81.83 | 93.22 | 99.63 | 97.59 | 89.82 | 62.58 | 99.26 | 92.88 | 96.06 | 97.32 |
| MrLight/dse-qwen2-2b-mr1-v1 | 84.48 | 66.64 | 79.39 | 96.45 | 95.30 | 84.53 | 55.47 | 96.85 | 86.39 | 91.80 | 92.03 |
| MonoQwen2-VL-v0.1 | 87.64 | 79.50 | 76.38 | 98.39 | 93.63 | 89.50 | 57.47 | 98.39 | 92.12 | 95.29 | 95.75 |
tagM-BEIR (Text2Image, Image2Text, Benchmark Multimodal pour la Recherche par Instructions)

M-BEIR est un benchmark complet à grande échelle conçu pour former et évaluer des modèles de recherche multimodale. Il comprend huit tâches de recherche multimodale et dix ensembles de données provenant de divers domaines et sources. Le benchmark se concentre sur la recherche guidée par instructions.
| Model | MBEIR t2i VisualNews Recall@5 |
MBEIR t2i MSCOCO Recall@5 |
MBEIR t2i Fashion200K Recall@10 |
MBEIR i2t VisualNews Recall@5 |
MBEIR i2t MSCOCO Recall@5 |
MBEIR i2t Fashion200K Recall@10 |
|---|---|---|---|---|---|---|
| jina-reranker-m0 | 23.89 | 72.19 | 9.79 | 17.61 | 41.21 | 11.56 |
| jinaai/jina-clip-v2 | 15.42 | 52.28 | 7.03 | 11.63 | 28.80 | 8.78 |
| MonoQwen2-VL-v0.1 | 22.74 | 71.29 | 10.00 | 15.08 | 42.24 | 11.25 |
tagWinoground (Text2Text, Text2Image)

Winoground est une tâche et un jeu de données novateurs pour évaluer la capacité des modèles de vision et de langage à effectuer un raisonnement compositionnel visio-linguistique. Il utilise des légendes jumelles avec un contenu lexical identique et emploie des paires image-légende contrastives. L'accent est mis sur le raisonnement compositionnel.
| Model | Text | Image | Group | Avg |
|---|---|---|---|---|
| jina-reranker-m0 | 57.00 | 40.75 | 34.00 | 43.92 |
| MrLight/dse-qwen2-2b-mrl-v1 | 7.50 | 9.25 | 1.75 | 6.17 |
| MonoQwen2-VL-v0.1 | 52.00 | 36.25 | 31.50 | 39.92 |
Winoground évalue les modèles vision-langage selon trois métriques clés : le Score Textuel, le Score d'Image et le Score de Groupe. Le Score Textuel mesure si un modèle associe correctement les légendes aux images, tandis que le Score d'Image évalue s'il sélectionne la bonne image pour une légende. Le Score de Groupe, la métrique la plus rigoureuse, exige que toutes les relations légende-image soient correctement identifiées. Les scores sont des pourcentages représentant les taux de précision, les valeurs plus élevées indiquant de meilleures capacités de raisonnement.
tagConclusion
jina-reranker-m0 est notre première tentative d'unifier les modalités textuelles et visuelles dans un modèle decoder-only unique. Cette nouvelle architecture intègre les leçons tirées de nos précédents modèles de récupération encoder-only, notamment jina-clip-v2, jina-embeddings-v3, jina-reranker-v2-base-multilingual et jina-embeddings-v2-base-code.
Le nouveau modèle débloque non seulement des capacités pour les tâches de recherche multimodale, comme le reclassement texte-image et le reclassement de documents visuels, mais démontre également une performance améliorée par rapport à jina-reranker-v2-base-multilingual sur les tâches de reclassement texte-texte et texte-code. Nous désignons cette nouvelle série de modèles comme la « série m » pour souligner sa nature multimodale.
En comparant jina-reranker-m0 avec jina-reranker-v2-base-multilingual, notre objectif pour la série m est d'atteindre la multimodalité tout en améliorant les performances sur les tâches uniquement textuelles à un niveau comparable aux modèles spécialisés texte uniquement. Certains pourraient questionner l'intérêt d'utiliser un modèle 8 fois plus grand si l'amélioration des performances sur les tâches textuelles semble marginale. Bien qu'il soit vrai pour le moment que m0 n'apporte peut-être pas une valeur ajoutée substantielle par rapport à v2 pour les applications uniquement textuelles, l'architecture decoder-only ouvre de nombreuses nouvelles possibilités qui n'étaient pas réalisables avec les architectures encoder-only, notamment :
- Un véritable reclassement multimodal
- Reclassement par liste et déduplication des documents
- Explicabilité des scores de classement via le mécanisme d'attention
Nos travaux futurs se concentreront sur l'amélioration du reclasseur texte uniquement et l'exploitation complète des nouvelles fonctionnalités rendues possibles par cette architecture multimodale pour obtenir une recherche meilleure et plus étendue.














