Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Nouvelle Architecture
Pour Commencer
Évaluation
Conclusion
star
Mis en exergue
communiqué de presse
avril 08, 2025

jina-reranker-m0 : Reclasseur multilingue et multimodal de documents

Présentation de jina-reranker-m0, notre nouveau réordonnanceur multimodal multilingue pour la recherche de documents visuels, offrant des performances à l'état de l'art sur la recherche de longs documents multilingues et de code source.
Jina AI • 20 minutes lues
jinaai/jina-reranker-m0 · Hugging Face
Nous sommes en mission pour faire progresser et démocratiser l'intelligence artificielle grâce à l'open source et la science ouverte.

Aujourd'hui, nous publions jina-reranker-m0, notre nouveau modèle de réorganisation multilingue et multimodal pour le classement de documents visuels dans plusieurs langues : il accepte une requête ainsi qu'une collection d'images de documents riches en contenu visuel, y compris des pages contenant du texte, des figures, des tableaux, des infographies et diverses mises en page dans de multiples domaines et plus de 29 langues. Il produit une liste classée de documents ordonnés selon leur pertinence par rapport à la requête d'entrée. Par rapport à jina-reranker-v2-base-multilingual, jina-reranker-m0 améliore également le reclassement de texte pour le contenu multilingue, les longs documents et les tâches de recherche de code.

Les performances de jina-reranker-m0 sur les benchmarks de recherche visuelle ViDoRe, MBEIR et Winoground démontrent ses capacités dans diverses tâches de recherche multimodale couvrant plusieurs domaines et langues. Chaque point représente les scores de performance pour différents types/tâches de documents visuels. Les boîtes à moustaches illustrent la distribution de ces scores, les nombres mis en évidence indiquant la performance moyenne. Pour les résultats complets des benchmarks, veuillez consulter l'annexe de cet article.
Ce graphique en boîte montre les performances de jina-reranker-m0 sur quatre benchmarks de reclassement uniquement textuel. Chaque benchmark peut inclure plusieurs jeux de données, langues ou tâches, représentés par des points individuels dans la boîte. La boîte montre la distribution de ces scores, le nombre mis en évidence indiquant la performance moyenne. Bien que la plupart des benchmarks utilisent NDCG@10 comme métrique de performance, MKQA utilise recall@10, car les données d'annotation de MKQA ne permettent pas le calcul du NDCG (l'évaluation officielle utilise le recall, qui détermine la pertinence des documents par des heuristiques). Les résultats complets des benchmarks sont disponibles dans l'annexe de cet article.

tagNouvelle Architecture

L'architecture de jina-reranker-m0 est basée sur Qwen2-VL-2B et comprend 2,1 milliards de paramètres. Ce modèle classe efficacement les documents en évaluant leurs éléments visuels et textuels par rapport aux requêtes, en utilisant une comparaison par paires.

Contrairement à jina-reranker-v2-base-multilingual, jina-reranker-m0 passe de l'architecture classique cross-encoder à un modèle de langage visuel decoder-only. Il utilise l'encodeur et le projecteur de vision préentraînés de Qwen2-VL, a affiné son LLM avec LoRA, et a post-entraîné un MLP pour générer des logits de classement qui mesurent la pertinence requête-document. Cela donne un modèle discriminatif optimisé pour les tâches de classement.

jina-reranker-m0 jina-reranker-v2
Architecture Vision Language Model Cross-Encoder
Base model Qwen2-VL-2B Jina-XLM-RoBERTa
Parameters 2.4 B 278 M
Max context length (query + document) 10,240 8,192
Max image patches (dynamic resolution) 768 × 28 × 28 ❌
Multilingual support ✅ ✅
Tasks supported Text2Text, Text2Image, Image2Text, Text2Mixed Text2Text

Cette nouvelle architecture permet à jina-reranker-m0 de gérer jusqu'à 32K tokens, combinant harmonieusement les entrées visuelles et textuelles. Le modèle prend en charge des images allant d'une taille minimale de 56×56 pixels jusqu'à une résolution 4K. Lors du traitement des images, le ViT et le projecteur condensent les tokens adjacents 2×2 en tokens visuels uniques pour l'entrée du LLM. Des tokens spéciaux comme <|vision_start|> et <|vision_end|> marquent clairement les limites des tokens visuels, permettant au modèle de langage de traiter correctement les informations visuelles et d'effectuer un raisonnement multimodal sophistiqué qui intègre à la fois les éléments visuels et textuels.

Cette architecture résout également efficacement le problème d'écart entre modalités qui affectait les modèles précédents comme jina-clip-v1 et jina-clip-v2. Auparavant, les images se regroupaient près d'autres images tandis que le texte se regroupait près d'autre texte dans l'espace de représentation, créant une déconnexion. Cela signifiait que lorsque vos documents candidats contenaient à la fois des images et du texte, la recherche d'images à l'aide de requêtes textuelles était problématique. Avec jina-reranker-m0, vous pouvez désormais classer les images et les documents ensemble sans vous soucier de cet écart, créant une expérience de recherche multimodale véritablement unifiée.

Dans les systèmes de recherche multimodale, un "écart de modalité" fait référence à la différence dans la façon dont le modèle évalue la similarité texte-texte par rapport à la similarité texte-image. En regardant l'image de gauche (jina-clip-v2), il y a une séparation claire entre les deux distributions : La distribution de similarité texte-texte (rouge) culmine autour de 0,35. La similarité texte-image (bleue) culmine autour de 0,65-0,7. Cette séparation significative indique un grand écart de modalité - le modèle évalue les paires texte-texte et texte-image dans des plages fondamentalement différentes. Cela rend difficile la comparaison directe des scores entre les modalités. Dans un système sans écart de modalité, nous nous attendrions à ce que les distributions se chevauchent largement, ce qui signifie que le modèle évalue les deux types de paires dans des plages similaires basées uniquement sur la pertinence, et non sur le type de modalité.

Il convient de noter que notre entraînement était limité à un maximum de 10K tokens d'entrée, avec jusqu'à 768 tokens par image (entre les marqueurs <|vision_start|> et <|vision_end|>). De plus, nous n'avons pas spécifiquement entraîné le modèle pour les tâches de reclassement image-to-image, image-to-multimodal, ou text-to-multimodal. Dans ce contexte, "multimodal" fait référence à un document unique contenant à la fois des tokens d'image et de texte en entrée. En examinant toutes les combinaisons possibles de tokens d'image et de texte dans les requêtes et les documents, nous pouvons résumer la gamme complète des tâches prises en charge par jina-reranker-m0 dans le tableau ci-dessous.

jina-reranker-m0 prend en charge une large gamme de combinaisons de requêtes et de documents pour le reclassement. Il atteint des performances de pointe dans les tâches texte-texte, texte-image, image-texte et texte-mixte-unimodal, grâce à un entraînement approfondi. Le modèle gère également d'autres combinaisons d'entrées de manière zero-shot - l'architecture s'adapte à ces combinaisons de tokens, bien que nous ne l'ayons pas spécifiquement entraîné pour ces tâches.

Dans nos tests, nous avons trouvé des indices suggérant que le modèle peut extrapoler à ces tâches de classement non entraînées, mais toute efficacité dans ces domaines doit être considérée comme le résultat de la transférabilité zero-shot du modèle ou d'effets secondaires non intentionnels de l'entraînement. Nous n'avons pas effectué d'évaluations sérieuses des performances du modèle sur ces tâches, et prévoyons d'explorer ces capacités plus en profondeur dans de futures recherches.

tagPour Commencer

tagVia API

Le code ci-dessous montre comment calculer les scores de pertinence entre la requête "small language model data extraction" et une collection d'images et de documents textuels. Vous pouvez passer une chaîne de texte, une image encodée en base64 ou une URL d'image. Les nouveaux utilisateurs peuvent obtenir une clé API Jina avec 1 million de tokens gratuits. Bien que notre API ne prenne pas en charge l'utilisation d'images comme requêtes, vous pouvez utiliser des images comme requêtes lors de l'accès au modèle via la bibliothèque Hugging Face Transformers.

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer JINA_API_KEY" \
  -d '{
  "model": "jina-reranker-m0",
  "query": "small language model data extraction",
  "documents": [
    {
      "image": "https://raw.githubusercontent.com/jina-ai/multimodal-reranker-test/main/handelsblatt-preview.png"
    },
    {
      "image": "https://raw.githubusercontent.com/jina-ai/multimodal-reranker-test/main/paper-11.png"
    },
    {
      "image": "https://raw.githubusercontent.com/jina-ai/multimodal-reranker-test/main/wired-preview.png"
    },
    {
      "text": "We present ReaderLM-v2, a compact 1.5 billion parameter language model designed for efficient web content extraction. Our model processes documents up to 512K tokens, transforming messy HTML into clean Markdown or JSON formats with high accuracy -- making it an ideal tool for grounding large language models. The models effectiveness results from two key innovations: (1) a three-stage data synthesis pipeline that generates high quality, diverse training data by iteratively drafting, refining, and critiquing web content extraction; and (2) a unified training framework combining continuous pre-training with multi-objective optimization. Intensive evaluation demonstrates that ReaderLM-v2 outperforms GPT-4o-2024-08-06 and other larger models by 15-20% on carefully curated benchmarks, particularly excelling at documents exceeding 100K tokens, while maintaining significantly lower computational requirements."
    },
    {
      "image": "https://jina.ai/blog-banner/using-deepseek-r1-reasoning-model-in-deepsearch.webp"
    },
    {
      "text": "数据提取么?为什么不用正则啊,你用正则不就全解决了么?"
    },
    {
      "text": "During the California Gold Rush, some merchants made more money selling supplies to miners than the miners made finding gold."
    },
    {
      "text": "Die wichtigsten Beiträge unserer Arbeit sind zweifach: Erstens führen wir eine neuartige dreistufige Datensynthese-Pipeline namens Draft-Refine-Critique ein, die durch iterative Verfeinerung hochwertige Trainingsdaten generiert; und zweitens schlagen wir eine umfassende Trainingsstrategie vor, die kontinuierliches Vortraining zur Längenerweiterung, überwachtes Feintuning mit spezialisierten Kontrollpunkten, direkte Präferenzoptimierung (DPO) und iteratives Self-Play-Tuning kombiniert. Um die weitere Forschung und Anwendung der strukturierten Inhaltsextraktion zu erleichtern, ist das Modell auf Hugging Face öffentlich verfügbar."
    }
  ],
  "return_documents": false
}'

La réponse est affichée ci-dessous, où le premier résultat index=1 correspond à notre capture d'écran du papier ReaderLM-v2 paper screenshot.

{"model":"jina-reranker-m0","usage":{"total_tokens":2829},"results":[{"index":1,"relevance_score":0.9587112551898949},{"index":3,"relevance_score":0.9337408271911014},{"index":7,"relevance_score":0.8922925217195924},{"index":2,"relevance_score":0.8891905997562045},{"index":0,"relevance_score":0.8827516945848907},{"index":4,"relevance_score":0.8701035914834407},{"index":6,"relevance_score":0.8676828987527296},{"index":5,"relevance_score":0.8455347349164652}]}

tagVia les Places de Marché CSP

jina-reranker-m0 sera bientôt disponible directement sur AWS, Azure et GCP aux prix indiqués.

tagVia HuggingFace

Vous pouvez également utiliser le modèle localement depuis notre page Hugging Face. Nous avons préparé un notebook Google Colab qui démontre son fonctionnement. Par rapport à notre API web, l'utilisation locale du modèle offre une plus grande flexibilité, comme la possibilité d'utiliser des images comme requêtes et de travailler avec des documents multimodaux.

Google Colab

tagÉvaluation

[public]-jina-reranker-m0-evaluation-results
Google Docs

Les évaluations complètes sont disponibles dans ce Google Spreadsheet.

tagBEIR (Texte2Texte, Anglais uniquement)

BEIR: A Heterogenous Benchmark for Zero-shot Evaluation of Information Retrieval Models
Existing neural information retrieval (IR) models have often been studied in homogeneous and narrow settings, which has considerably limited insights into their out-of-distribution (OOD) generalization capabilities. To address this, and to facilitate researchers to broadly evaluate the effectiveness of their models, we introduce Benchmarking-IR (BEIR), a robust and heterogeneous evaluation benchmark for information retrieval. We leverage a careful selection of 18 publicly available datasets from diverse text retrieval tasks and domains and evaluate 10 state-of-the-art retrieval systems including lexical, sparse, dense, late-interaction and re-ranking architectures on the BEIR benchmark. Our results show BM25 is a robust baseline and re-ranking and late-interaction-based models on average achieve the best zero-shot performances, however, at high computational costs. In contrast, dense and sparse-retrieval models are computationally more efficient but often underperform other approaches, highlighting the considerable room for improvement in their generalization capabilities. We hope this framework allows us to better evaluate and understand existing retrieval systems, and contributes to accelerating progress towards better robust and generalizable systems in the future. BEIR is publicly available at https://github.com/UKPLab/beir.
arXiv.orgNandan Thakur

BEIR est un référentiel hétérogène pour la recherche d'informations, conçu pour évaluer la polyvalence et la robustesse des modèles IR. Il contient un ensemble diversifié de jeux de données provenant de différents domaines et se concentre sur l'évaluation zero-shot. Des métriques d'évaluation standardisées telles que NDCG, Recall@K et MRR sont utilisées.

Model AVG (NDCG@10) TREC-COVID NFCorpus NQ HotpotQA FiQA ArguAna Touche-2020 DBPedia SCIDOCS FEVER Climate-FEVER SciFact Quora
jina-reranker-m0 58.95 84.17 41.03 72.25 76.99 51.62 40.69 31.79 49.34 22.91 91.14 36.42 79.94 88.01
jina-embeddings-v3 (1024 tokens) 55.81 77.81 36.65 64.31 64.63 47.47 54.31 26.55 41.07 19.91 89.00 42.33 72.4 89.06
bge-reranker-v2-m3 56.51 82.19 34.33 69.52 77.89 45.45 36.21 33.12 46.72 17.79 91.03 38.69 72.64 89.10
jina-reranker-v2-multilingual 57.06 80.53 37.17 67.39 76.17 46.48 39.28 32.35 47.81 20.03 93.02 37.17 76.50 87.83

tagMIRACL (Text2Text, Multilingue, 18 langues)

Making a MIRACL : Recherche d'information multilingue à travers un continuum de langues
MIRACL (Recherche d'information multilingue à travers un continuum de langues) est un jeu de données multilingue que nous avons construit pour le challenge WSDM 2023 Cup qui se concentre sur la recherche ad hoc dans 18 langues différentes, qui représentent collectivement plus de trois milliards de locuteurs natifs dans le monde. Ces langues ont des typologies diverses, proviennent de nombreuses familles linguistiques différentes et sont associées à des quantités variables de ressources disponibles -- incluant ce que les chercheurs caractérisent généralement comme des langues très dotées et peu dotées. Notre jeu de données est conçu pour soutenir la création et l'évaluation de modèles de recherche monolingue, où les requêtes et les corpus sont dans la même langue. Au total, nous avons rassemblé plus de 700k jugements de pertinence de haute qualité pour environ 77k requêtes sur Wikipedia dans ces 18 langues, où toutes les évaluations ont été effectuées par des locuteurs natifs embauchés par notre équipe. Notre objectif est de stimuler la recherche qui améliorera la recherche à travers un continuum de langues, améliorant ainsi les capacités d'accès à l'information pour diverses populations à travers le monde, en particulier celles qui ont été traditionnellement mal desservies. Cet article de présentation décrit le jeu de données et les références que nous partageons avec la communauté. Le site web MIRACL est accessible sur http://miracl.ai/.
arXiv.orgXinyu Zhang

MIRACL est un large jeu de données multilingue pour la recherche d'informations ad hoc couvrant 18 langues. Il englobe plus de trois milliards de locuteurs natifs et comprend des annotations humaines approfondies. L'accent est mis sur les tâches de recherche monolingue.

Model AVG (NDCG@10) ar bn en es fa fi fr hi id ja ko ru sw te th zh de yo
jina-reranker-m0 66.75 79.78 78.01 59.21 53.56 58.80 78.00 56.66 62.83 54.92 66.51 72.86 67.26 59.04 70.19 80.37 64.51 58.50 80.44
jina-embeddings-v3 (8192 tokens) 58.90 71.53 69.86 48.37 46.91 54.13 71.15 50.90 55.05 47.83 56.46 64.76 55.63 54.07 70.48 73.56 55.29 49.18 65.01
bge-reranker-v2-m3 69.32 80.51 81.85 57.67 57.64 61.92 80.38 59.60 67.66 58.86 67.37 75.14 67.61 68.92 76.69 82.29 64.46 58.32 80.85
jina-reranker-v2-multilingual 63.65 72.50 79.42 46.66 51.54 57.81 73.05 50.90 60.94 56.66 59.15 72.60 53.43 66.47 74.62 77.75 62.49 53.06 76.69

tagMLDR (Text2Text, Documents longs multilingues, 13 langues)

BGE M3-Embedding : Embeddings de texte Multi-Lingues, Multi-Fonctionnels, Multi-Granularité par auto-distillation de connaissances
Dans cet article, nous présentons un nouveau modèle d'embedding, appelé M3-Embedding, qui se distingue par sa polyvalence en termes de Multi-Lingualité, Multi-Fonctionnalité et Multi-Granularité. Il peut prendre en charge plus de 100 langues de travail, établissant de nouveaux records de performance sur les tâches de recherche multilingues et interlingues. Il peut simultanément exécuter les trois fonctionnalités de recherche courantes du modèle d'embedding : recherche dense, recherche multi-vecteurs et recherche éparse, fournissant ainsi une base de modèle unifiée pour les applications IR du monde réel. Il est capable de traiter des entrées de différentes granularités, allant des phrases courtes aux documents longs jusqu'à 8192 tokens. L'entraînement efficace de M3-Embedding implique les contributions techniques suivantes. Nous proposons une nouvelle approche d'auto-distillation des connaissances, où les scores de pertinence de différentes fonctionnalités de recherche peuvent être intégrés comme signal d'apprentissage. Nous optimisons également la stratégie de traitement par lots, permettant une grande taille de lot et un débit d'entraînement élevé pour assurer le caractère discriminant des embeddings. À notre connaissance, M3-Embedding est le premier modèle d'embedding qui réalise une telle polyvalence. Le modèle et le code seront disponibles publiquement sur https://github.com/FlagOpen/FlagEmbedding.
arXiv.orgJianlv Chen

MLDR est un jeu de données multilingue spécialement conçu pour la recherche de documents longs, couvrant 13 langues. Il utilise GPT-3.5 pour générer des questions pour les documents. Le jeu de données est construit à partir de Wikipedia, Wudao et mC4.

Model AVG (NDCG@10) ar de en es fr hi it ja ko pt ru th zh
jina-reranker-m0 59.83 55.86 51.25 54.67 87.63 82.59 32.76 73.25 58.93 55.73 86.08 66.73 39.17 33.14
jina-embeddings-v3 (8192 tokens) 39.71 28.44 31.57 29.07 62.08 59.79 25.47 53.72 38.36 32.37 63.26 49.65 25.15 17.26
bge-reranker-v2-m3 53.53 49.19 45.39 43.92 74.57 68.67 44.75 62.79 49.27 48.24 76.45 62.84 38.82 31.02
jina-reranker-v2-multilingual 59.50 51.96 50.13 46.85 86.34 82.25 49.50 69.00 59.07 52.19 85.26 68.06 38.73 34.15

tagMKQA (Text2Text, Question-Réponse Multilingue, 24 langues, 3 variantes pour le chinois)

MKQA : Un benchmark linguistiquement diversifié pour les questions-réponses multilingues en domaine ouvert
Les progrès en modélisation multilingue dépendent d'ensembles d'évaluation stimulants, réalistes et diversifiés. Nous présentons Multilingual Knowledge Questions and Answers (MKQA), un ensemble d'évaluation de questions-réponses en domaine ouvert comprenant 10k paires de questions-réponses alignées sur 26 langues typologiquement diverses (260k paires de questions-réponses au total). Les réponses sont basées sur une représentation de données indépendante de la langue et fortement organisée, rendant les résultats comparables entre les langues et indépendants des passages spécifiques à chaque langue. Avec 26 langues, ce jeu de données offre la plus large gamme de langues à ce jour pour évaluer les systèmes de questions-réponses. Nous évaluons diverses méthodes et références de l'état de l'art pour les questions-réponses génératives et extractives, entraînées sur Natural Questions, dans des contextes zero-shot et de traduction. Les résultats indiquent que ce jeu de données est difficile même en anglais, mais particulièrement dans les langues peu dotées.
arXiv.orgShayne Longpre

MKQA est un ensemble d'évaluation de questions-réponses en domaine ouvert comprenant 10 000 paires de questions-réponses alignées sur 26 langues typologiquement diverses. Les paires de questions-réponses sont échantillonnées à partir de Google Natural Questions.

Model AVG (recall@10) ar da de es en fi fr he hu it ja km ko ms nl no pl pt ru sv th tr vi zh_cn zh_hk zh_tw
jina-reranker-m0 68.19 63.88 70.57 70.52 71.26 73.47 64.10 71.11 63.68 63.23 70.30 69.13 50.43 64.30 70.78 71.73 70.25 69.72 70.57 70.78 70.69 69.80 67.90 69.68 69.12 68.23 67.79
jina-embeddings-v3 (8192 tokens) 65.63 59.00 69.12 68.27 68.15 71.14 65.66 68.30 59.51 63.23 68.30 64.36 56.13 58.98 68.30 69.53 68.65 67.26 67.93 67.06 68.68 66.32 66.97 66.87 63.38 63.59 61.55
bge-reranker-v2-m3 67.88 63.09 70.15 68.91 68.92 73.00 68.71 68.71 70.27 64.00 68.15 68.47 60.43 63.95 68.80 70.77 69.10 67.44 67.40 69.77 70.03 69.68 66.04 68.29 67.84 66.70 66.34
jina-reranker-v2-multilingual 67.90 63.88 70.31 70.09 70.51 73.09 67.50 70.38 63.00 64.59 69.90 67.34 57.79 62.14 70.36 71.58 69.51 68.61 70.13 70.07 70.15 68.80 68.02 69.39 67.23 65.77 65.37

tagCoIR (Text2Text, Recherche d'Information dans le Code)

CoIR : Un benchmark complet pour les modèles de recherche d'information dans le code
Malgré le succès substantiel de la Recherche d'Information (RI) dans diverses tâches de TALN, la plupart des systèmes de RI traitent principalement des requêtes et des corpus en langage naturel, négligeant le domaine de la recherche de code. La recherche de code est d'une importance critique mais reste peu explorée, les méthodes et benchmarks existants ne représentant pas adéquatement la diversité du code dans divers domaines et tâches. Pour combler cette lacune, nous présentons COIR (Code Information Retrieval Benchmark), un benchmark robuste et complet spécifiquement conçu pour évaluer les capacités de recherche de code. COIR comprend dix jeux de données de code méticuleusement organisés, couvrant huit tâches distinctes de recherche à travers sept domaines différents. Nous discutons d'abord de la construction de COIR et de la composition diverse de ses jeux de données. De plus, nous évaluons neuf modèles de recherche largement utilisés avec COIR, révélant des difficultés significatives dans l'exécution des tâches de recherche de code, même avec des systèmes à la pointe de la technologie. Pour faciliter son adoption et son intégration dans les flux de recherche existants, COIR a été développé comme un framework Python convivial, facilement installable via pip. Il partage le même schéma de données que d'autres benchmarks populaires comme MTEB et BEIR, permettant des évaluations transparentes entre benchmarks. Avec COIR, nous visons à dynamiser la recherche dans le domaine de la recherche de code, en fournissant un outil de benchmarking polyvalent qui encourage le développement et l'exploration des systèmes de recherche de code https://github.com/CoIR-team/coir.
arXiv.orgXiangyang Li

CoIR est un benchmark complet conçu pour évaluer les capacités des modèles en matière de recherche de code. Il comprend 10 jeux de données de code couvrant 8 tâches de recherche dans 7 domaines différents. Un framework Python est fourni pour ce benchmark.

Model Name Avg (NDCG@10) Text-to-Code Code-to-Text Code-to-Code Hybrid Code
Apps CosQA SQL CSN CSN-CCR CodeTransOcean StackOver
Flow
CodeFeedBack
AVG python javascript go ruby java php AVG python javascript go ruby java php -Contest -DL -MT -ST
jina-reranker-m0 63.55 26.21 37.75 57.92 80.76 98.37 71.16 86.14 72.74 79.02 77.14 74.57 81.66 77.92 68.71 75.44 77.54 66.13 79.79 31.89 90.41 72.25 83.95
jina-embeddings-v2-base-code
(top 100)
56.90 16.34 41.72 49.79 83.95 94.71 76.35 87.39 78.23 82.69 84.35 59.65 68.23 62.31 49.15 65.40 63.89 48.92 79.20 30.35 89.42 49.62 68.93
bge-reranker-v2-m3 35.97 8.33 30.06 50.63 49.26 67.62 39.55 58.11 41.37 44.77 44.13 40.81 42.57 42.75 38.04 38.04 41.73 41.73 34.93 5.09 60.12 16.44 64.05
jina-reranker-v2-multilingual 56.14 21.90 37.26 53.56 78.88 97.83 67.43 84.64 68.93 75.73 78.71 63.59 72.62 67.80 55.07 67.25 64.25 54.54 73.67 25.74 91.24 42.03 73.59

tagViDoRe (Benchmark de recherche de documents visuels Text2Image)

ColPali : Recherche efficace de documents avec des modèles de vision et de langage
Les documents sont des structures visuellement riches qui transmettent l'information à travers le texte, mais aussi les figures, les mises en page, les tableaux, ou même les polices. Comme les systèmes de recherche modernes s'appuient principalement sur l'information textuelle qu'ils extraient des pages de documents pour les indexer - souvent par des processus longs et fragiles - ils peinent à exploiter efficacement les indices visuels clés. Cela limite leurs capacités dans de nombreuses applications pratiques de recherche de documents comme la Génération Augmentée par Recherche (RAG). Pour évaluer les systèmes actuels sur la recherche de documents visuellement riches, nous présentons le benchmark de recherche de documents visuels ViDoRe, composé de diverses tâches de recherche au niveau des pages couvrant plusieurs domaines, langues et contextes pratiques. La complexité inhérente et les lacunes de performance des systèmes modernes motivent un nouveau concept : effectuer la recherche de documents en incorporant directement les images des pages de documents. Nous publions ColPali, un modèle de vision et de langage entraîné à produire des embeddings multi-vecteurs de haute qualité à partir d'images de pages de documents. Combiné à un mécanisme de correspondance à interaction tardive, ColPali surpasse largement les pipelines modernes de recherche de documents tout en étant drastiquement plus simple, plus rapide et entraînable de bout en bout. Nous publions les modèles, données, code et benchmarks sous licences ouvertes sur https://hf.co/vidore.
arXiv.orgManuel Faysse

ViDoRe est un benchmark conçu pour évaluer la capacité des systèmes de recherche à faire correspondre des requêtes avec des documents pertinents en utilisant des caractéristiques visuelles. Il couvre diverses tâches de recherche au niveau de la page dans plusieurs domaines et langues. Le benchmark se concentre sur les éléments visuels des documents.

Model Name AVG
(NDCG@5)
TAT-DQA Shift
Project
Artificial
Intelligence
Government
Reports
ArxivQA DocVQA Healthcare
Industry
InfoVQA Energy TabFQuad
jina-reranker-m0 91.02 81.83 93.22 99.63 97.59 89.82 62.58 99.26 92.88 96.06 97.32
MrLight/dse-qwen2-2b-mr1-v1 84.48 66.64 79.39 96.45 95.30 84.53 55.47 96.85 86.39 91.80 92.03
MonoQwen2-VL-v0.1 87.64 79.50 76.38 98.39 93.63 89.50 57.47 98.39 92.12 95.29 95.75

tagM-BEIR (Text2Image, Image2Text, Benchmark Multimodal pour la Recherche par Instructions)

UniIR : Formation et Évaluation de Systèmes Universels de Recherche d'Information Multimodale
Les modèles de recherche d'information (RI) existants supposent souvent un format homogène, limitant leur applicabilité aux divers besoins des utilisateurs, comme la recherche d'images avec des descriptions textuelles, la recherche d'un article d'actualité avec une image d'en-tête, ou la recherche d'une photo similaire avec une image en requête. Pour répondre à ces différentes demandes de recherche d'information, nous présentons UniIR, un système unifié de recherche multimodale guidé par instructions capable de gérer huit tâches de recherche distinctes à travers les modalités. UniIR, un système de recherche unique entraîné conjointement sur dix ensembles de données multimodales-RI diverses, interprète les instructions des utilisateurs pour exécuter diverses tâches de recherche, démontrant des performances robustes sur les ensembles de données existants et une généralisation zero-shot à de nouvelles tâches. Nos expériences soulignent que l'entraînement multi-tâches et l'ajustement des instructions sont les clés de la capacité de généralisation d'UniIR. De plus, nous construisons M-BEIR, un benchmark de recherche multimodale avec des résultats complets, pour standardiser l'évaluation de la recherche d'information multimodale universelle.
arXiv.orgCong Wei

M-BEIR est un benchmark complet à grande échelle conçu pour former et évaluer des modèles de recherche multimodale. Il comprend huit tâches de recherche multimodale et dix ensembles de données provenant de divers domaines et sources. Le benchmark se concentre sur la recherche guidée par instructions.

Model MBEIR t2i VisualNews
Recall@5
MBEIR t2i MSCOCO
Recall@5
MBEIR t2i Fashion200K
Recall@10
MBEIR i2t VisualNews
Recall@5
MBEIR i2t MSCOCO
Recall@5
MBEIR i2t Fashion200K
Recall@10
jina-reranker-m0 23.89 72.19 9.79 17.61 41.21 11.56
jinaai/jina-clip-v2 15.42 52.28 7.03 11.63 28.80 8.78
MonoQwen2-VL-v0.1 22.74 71.29 10.00 15.08 42.24 11.25

tagWinoground (Text2Text, Text2Image)

Winoground : Évaluation des Modèles de Vision et de Langage pour la Composition Visio-Linguistique
Nous présentons une nouvelle tâche et un nouveau jeu de données pour évaluer la capacité des modèles de vision et de langage à effectuer un raisonnement compositionnel visio-linguistique, que nous appelons Winoground. Étant donné deux images et deux légendes, l'objectif est de les faire correspondre correctement - mais crucialement, les deux légendes contiennent un ensemble de mots complètement identique, uniquement dans un ordre différent. Le jeu de données a été soigneusement créé manuellement par des annotateurs experts et est étiqueté avec un riche ensemble de balises détaillées pour faciliter l'analyse des performances des modèles. Nous testons une gamme diverse de modèles de vision et de langage à la pointe de la technologie et constatons que, étonnamment, aucun d'entre eux ne fait beaucoup mieux que le hasard. Manifestement, ces modèles ne sont pas aussi compétents en raisonnement compositionnel visio-linguistique que nous aurions pu l'espérer. Nous effectuons une analyse approfondie pour obtenir des insights sur la façon dont les travaux futurs pourraient tenter d'atténuer les lacunes de ces modèles. Nous visons à ce que Winoground serve d'ensemble d'évaluation utile pour faire progresser l'état de l'art et stimuler les progrès dans ce domaine. Le jeu de données est disponible sur https://huggingface.co/datasets/facebook/winoground.
arXiv.orgTristan Thrush

Winoground est une tâche et un jeu de données novateurs pour évaluer la capacité des modèles de vision et de langage à effectuer un raisonnement compositionnel visio-linguistique. Il utilise des légendes jumelles avec un contenu lexical identique et emploie des paires image-légende contrastives. L'accent est mis sur le raisonnement compositionnel.

Model Text Image Group Avg
jina-reranker-m0 57.00 40.75 34.00 43.92
MrLight/dse-qwen2-2b-mrl-v1 7.50 9.25 1.75 6.17
MonoQwen2-VL-v0.1 52.00 36.25 31.50 39.92

Winoground évalue les modèles vision-langage selon trois métriques clés : le Score Textuel, le Score d'Image et le Score de Groupe. Le Score Textuel mesure si un modèle associe correctement les légendes aux images, tandis que le Score d'Image évalue s'il sélectionne la bonne image pour une légende. Le Score de Groupe, la métrique la plus rigoureuse, exige que toutes les relations légende-image soient correctement identifiées. Les scores sont des pourcentages représentant les taux de précision, les valeurs plus élevées indiquant de meilleures capacités de raisonnement.

tagConclusion

jina-reranker-m0 est notre première tentative d'unifier les modalités textuelles et visuelles dans un modèle decoder-only unique. Cette nouvelle architecture intègre les leçons tirées de nos précédents modèles de récupération encoder-only, notamment jina-clip-v2, jina-embeddings-v3, jina-reranker-v2-base-multilingual et jina-embeddings-v2-base-code.

Le nouveau modèle débloque non seulement des capacités pour les tâches de recherche multimodale, comme le reclassement texte-image et le reclassement de documents visuels, mais démontre également une performance améliorée par rapport à jina-reranker-v2-base-multilingual sur les tâches de reclassement texte-texte et texte-code. Nous désignons cette nouvelle série de modèles comme la « série m » pour souligner sa nature multimodale.

En comparant jina-reranker-m0 avec jina-reranker-v2-base-multilingual, notre objectif pour la série m est d'atteindre la multimodalité tout en améliorant les performances sur les tâches uniquement textuelles à un niveau comparable aux modèles spécialisés texte uniquement. Certains pourraient questionner l'intérêt d'utiliser un modèle 8 fois plus grand si l'amélioration des performances sur les tâches textuelles semble marginale. Bien qu'il soit vrai pour le moment que m0 n'apporte peut-être pas une valeur ajoutée substantielle par rapport à v2 pour les applications uniquement textuelles, l'architecture decoder-only ouvre de nombreuses nouvelles possibilités qui n'étaient pas réalisables avec les architectures encoder-only, notamment :

  • Un véritable reclassement multimodal
  • Reclassement par liste et déduplication des documents
  • Explicabilité des scores de classement via le mécanisme d'attention

Nos travaux futurs se concentreront sur l'amélioration du reclasseur texte uniquement et l'exploitation complète des nouvelles fonctionnalités rendues possibles par cette architecture multimodale pour obtenir une recherche meilleure et plus étendue.

Catégories:
star
Mis en exergue
communiqué de presse
rss_feed

En savoir plus
août 03, 2026 • 11 minutes lues
jina-reranker-v3.5: Faster Listwise Reranking with Hybrid Attention and Self-Distillation
Jina AI
mai 12, 2026 • 7 minutes lues
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
février 19, 2026 • 7 minutes lues
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.