Nous lançons JinaVDR (Visual Document Retrieval), un nouveau benchmark pour évaluer la performance des modèles dans la récupération de documents visuellement complexes. JinaVDR englobe des documents multilingues avec des mises en page complexes, combinant des graphiques, des tableaux, du texte et des images, ainsi que des copies numérisées et des captures d'écran. Le benchmark associe ces divers documents visuels à des requêtes textuelles ciblées, permettant une évaluation complète des performances de récupération dans des conditions de complexité documentaire réelle et une couverture de domaine plus large.
| Benchmark | Objectif de la tâche | Langues | Nombre de tâches |
|---|---|---|---|
| JinaVDR | Documents visuellement riches | 20 langues | 95 |
| MIEB | Principalement des images naturelles | 38 langues | 130 |
| ViDoRe v1 | Documents visuellement riches | Anglais | 5 |
| ViDoRe v2 | Documents visuellement riches | Anglais, Français, Espagnol, Allemand | 4 |

JinaVDR couvre divers langues, domaines et formats de documents pour refléter les scénarios de récupération réels. Bien que l'anglais reste prédominant dans les requêtes et les documents, le benchmark incorpore plus d'une douzaine de langues supplémentaires, offrant une couverture multilingue significativement plus large. Les domaines englobent les documents historiques, la documentation logicielle, les dossiers médicaux, les textes juridiques et les articles scientifiques, capturant divers cas d'utilisation professionnels. Les formats de documents varient des pages web et des PDF aux documents numérisés, en passant par les diapositives de présentation et les images autonomes. De nombreux ensembles de données mélangent intentionnellement les langues et les formats, créant des conditions réalistes qui mettent les modèles au défi de gérer la complexité qu'ils rencontrent dans les applications pratiques.
tagComment nous avons construit JinaVDR
Le benchmark JinaVDR fournit un cadre d'évaluation couvrant 95 tâches dans 20 langues, y compris des documents riches en domaines et en mises en page tels que des graphiques, des cartes, des documents numérisés traditionnels, des fichiers Markdown et des tableaux complexes. Il évalue les modèles à travers à la fois des questions-réponses visuelles (par exemple, « Combien de poursuites civiles ont été rejetées à l'audience de Valladolid en 1855 ? ») et des requêtes par mots-clés (par exemple, « croissance du marché des LED dans différentes régions »), donnant une évaluation plus claire des capacités de récupération sur différents types de documents trouvés dans le monde réel.
Nous avons utilisé quatre techniques pour construire JinaVDR en nous concentrant sur la diversité des données et l'authenticité des tâches :
Premièrement, nous avons réaffecté des benchmarks existants en convertissant des ensembles de données OCR en tâches de récupération à l'aide de modèles de requête basés sur des règles (par exemple, en transformant les données MPMQA) et en reformattant les ensembles de données de questions-réponses en scénarios de récupération :

Deuxièmement, nous avons annoté manuellement les ensembles de données PDF existants, y compris StanfordSlides, TextbookQA et ShanghaiMasterPlan, pour créer des paires de récupération de haute qualité :

Notre troisième approche impliquait la génération synthétique de requêtes et/ou de documents, où nous avons utilisé des collections de documents existantes provenant de sources telles que Europeana pour créer des requêtes contextuellement pertinentes avec Qwen2-VL-7B-Instruct, ainsi que des descriptions textuelles EasyOCR :

Nous avons également rendu des ensembles de données tabulaires en tableaux visuels et généré des requêtes correspondantes via des modèles dérivés des données textuelles originales, comme démontré dans notre tâche AirBnBRetrieval.
Enfin, nous avons réaffecté des ensembles de données explorés existants avec des paires article-graphique, où nous utilisons des extraits de texte des articles comme requêtes et les graphiques correspondants comme documents cibles, comme le montre notre ensemble de données OWIDRetrieval :

Cette approche à multiples facettes nous offre une couverture complète des types de documents, des langues et des scénarios de récupération.
tagBenchmarks existants
Le développement de modèles véritablement multimodaux (capables de gérer des documents visuellement complexes) nécessite des benchmarks qui vont au-delà des méthodes d'évaluation traditionnelles basées uniquement sur du texte. Les cadres tels que MTEB (Massive Text Embedding Benchmark) peuvent bien fonctionner pour évaluer la récupération de texte dans différents domaines et langues, mais ils ne sont pas conçus pour la recherche dans des documents où une récupération précise dépend de la mise en page visuelle, des graphiques, des tableaux et du formatage. C'est là que les benchmarks de récupération de documents visuels (comme la série ViDoRe) et les benchmarks de récupération d'images (comme MIEB, le Massive Image Embedding Benchmark) entrent en jeu.
L'article ColPali paper a introduit ViDoRe v1, qui combine cinq ensembles de données en langue anglaise, à la fois académiques et synthétiques. Le benchmark se concentre sur les documents d'une seule page qui fonctionnent bien avec la reconnaissance optique de caractères (OCR), couvre des domaines étroits comme les articles scientifiques et les soins de santé, et utilise des requêtes extractives où les termes de recherche apparaissent souvent directement dans les documents cibles.

Après que des modèles comme ColPali ont atteint un score de 90 % nDCG@5 sur ViDoRe v1, un nouveau benchmark était nécessaire. ViDoRe v2 s'est amélioré par rapport à v1 en prenant en charge des requêtes plus longues et inter-documents, des requêtes contextuelles aveugles et plus de langues (français, allemand et espagnol en plus de l'anglais). Les deux benchmarks ont encore une diversité linguistique limitée et une couverture de domaine étroite, laissant des lacunes pour l'évaluation des nouveaux systèmes de récupération.

Le MIEB adopte une approche différente en se concentrant sur les 向量模型 visuels à travers 130 tâches, y compris d'autres tâches au-delà de la simple récupération. Cependant, il évalue principalement des images sans beaucoup de contenu textuel, plutôt que des documents visuellement riches. Bien que le benchmark soit excellent pour tester les capacités de compréhension visuelle, il ne fonctionne pas bien lorsque vous devez récupérer des documents en fonction de la mise en page visuelle et du contenu textuel.

Notre objectif avec le benchmark JinaVDR (Visual Document Retrieval) est de développer le travail de ces benchmarks précédents en incorporant des documents multilingues visuellement riches avec des mises en page complexes comme des graphiques, des diagrammes et des tableaux (mélangés à du texte et des images), ainsi qu'en ajoutant des requêtes et des questions du monde réel.
tagÉvaluation des 向量模型 sur JinaVDR
Nos résultats de benchmarking montrent que de nombreux modèles de 向量模型 récents ont du mal avec le large éventail de tâches de documents visuels de JinaVDR, tandis que les références basées sur l'OCR et les modèles plus anciens affichent des résultats encore plus faibles, en particulier sur les ensembles de données non anglais et de documents structurés. Nous avons inclus BM25 avec OCR pour tous les ensembles de données où une simple extraction de texte rendait cette récupération possible.
Une exception à cela est jina-embeddings-v4. Nos résultats suggèrent que son approche de 向量模型 multimodal gère mieux la récupération de documents complexes et multilingues que les modèles de génération antérieurs ou les pipelines traditionnels basés sur l'OCR. La capacité multi-vecteurs du modèle offre les meilleures performances car elle évite les limitations de compression des approches à vecteur unique — alors que les vecteurs uniques doivent entasser le contenu d'une page entière dans une seule représentation (ce qui rend difficile la capture de détails spécifiques), l'approche multi-vecteurs conserve les informations granulaires nécessaires à une récupération précise de documents similaires.

| Average | medical-prescriptions | DonutVQA | TableVQA | europeana-de-news | europeana-es-news | europeana-it-scans | europeana-nl-legal | hindi-gov-vqa | jdocqa_jp | wikimedia-commons-documents (ar) | github-readme-retrieval-ml-filtered (ru) | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BM25 + OCR | 26.67% | 38.18% | 19.39% | 35.64% | 11.26% | 51.99% | 39.11% | 34.97% | 1.83% | 1.64% | 19.60% | 39.78% |
jina-embeddings-v3 + OCR |
27.49% | 37.25% | 2.60% | 34.24% | 12.05% | 44.03% | 38.69% | 29.07% | 7.52% | 7.79% | 38.06% | 51.07% |
| jina-clip-v2 | 17.79% | 15.66% | 1.63% | 21.06% | 11.19% | 13.14% | 16.23% | 9.79% | 5.02% | 19.91% | 45.29% | 36.80% |
colpali-v1.2 |
46.44% | 83.91% | 32.53% | 54.66% | 34.64% | 44.74% | 54.32% | 30.89% | 13.04% | 39.45% | 41.96% | 80.67% |
colqwen2-v0.1 |
58.26% | 77.72% | 46.34% | 57.52% | 53.42% | 74.28% | 71.23% | 46.13% | 20.53% | 74.38% | 36.94% | 0.82388 |
MrLight/dse-qwen2-2b-mrl-v1 |
47.95% | 38.22% | 25.31% | 57.39% | 44.75% | 60.58% | 53.92% | 29.50% | 9.80% | 66.73% | 62.47% | 78.77% |
jina-embeddings-v4 (single-vector) |
61.39% | 81.17% | 78.48% | 58.90% | 49.05% | 60.10% | 57.88% | 37.14% | 15.40% | 75.57% | 72.07% | 89.55% |
jina-embeddings-v4 (multivector) |
70.89% | 97.95% | 73.55% | 60.91% | 65.65% | 80.58% | 73.14% | 54.15% | 21.94% | 82.34% | 81.19% | 88.39% |
tagIntégration MTEB
Étant donné que MTEB est devenu la norme de facto pour le benchmarking de la récupération, nous intégrons JinaVDR directement dans le framework MTEB pour maximiser l'adoption et la facilité d'utilisation. Cela permet aux chercheurs d'exécuter plus facilement des modèles de récupération visuelle sur notre benchmark en utilisant une infrastructure d'évaluation familière. Cependant, la migration de nos données vers le format BEIR a nécessité des compromis, comme le fait de ne pas inclure les résultats OCR dans la version MTEB. Cela signifie que les méthodes traditionnelles basées sur le texte comme BM25 ne sont pas directement exécutables dans le cadre de MTEB, ce qui renforce l'accent mis sur la compréhension des documents visuels plutôt que de se rabattre sur des méthodes de récupération basées sur le texte.
tagLimitations
Pour construire un benchmark complet à partir d'un large éventail de sources, nous avons dû effectuer un prétraitement minutieux pour garantir à la fois la convivialité pratique et la qualité de l'évaluation : Nous avons appliqué une normalisation de la taille en sous-échantillonnant chaque ensemble de données à un maximum de 1 000 exemples (contre des milliers ou des dizaines de milliers), ce qui rend le benchmark réellement exécutable tout en maintenant une bonne couverture des tâches. Cette contrainte était particulièrement importante étant donné les niveaux élevés de calcul dont nous avions besoin pour traiter des documents visuels haute résolution.
Nous avons utilisé un filtrage de la qualité pour répondre à plusieurs défis courants dans les collections de documents du monde réel. Bien que la mauvaise qualité d'image dans les documents numérisés reflète souvent des cas d'utilisation réalistes, elle a rendu plus difficile le contrôle de la qualité des données synthétiques. Nous avons mis en œuvre un filtrage de la cohérence pour supprimer les doublons (qui sont courants dans les grandes collections de documents) et utilisé des 大模型 pour filtrer les requêtes de faible qualité qui ne fourniraient pas de signaux d'évaluation utiles, telles que les questions trop génériques comme "What can you see in the chart?". Pour la génération de données synthétiques, nous avons rencontré des limitations dans la diversité des requêtes malgré l'utilisation de stratégies de 提示词 variées, et nous avons dû effectuer une curation manuelle pour garantir une couverture d'évaluation suffisante dans différents scénarios de récupération.
tagConclusion
L'évaluation de la récupération de documents visuels se trouve maintenant dans une situation où les benchmarks traditionnels basés sur le texte ne capturent plus la complexité de la façon dont les humains recherchent et consomment réellement l'information. JinaVDR surmonte cet obstacle en fournissant une évaluation complète sur un éventail de tâches et de langues dépassant de loin les benchmarks précédents.
Pour l'avenir, l'industrie a besoin de benchmarks qui reflètent de véritables défis de récupération plutôt que des contraintes artificielles. Au fur et à mesure que les organisations s'appuient davantage sur la récupération de documents visuels pour des tâches allant de la recherche juridique aux diagnostics médicaux, les frameworks d'évaluation doivent évoluer au-delà des ensembles de données académiques étroits vers les documents désordonnés, multilingues et visuellement complexes que nous trouvons dans le monde réel. JinaVDR n'est que la première étape dans la construction de systèmes de récupération qui comprennent vraiment comment l'information visuelle et textuelle fonctionnent ensemble dans la pratique.









