Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyAgentsdata_objectSchémamenu_bookDocuments



Se connecter
login
Comment nous avons construit JinaVDR
Benchmarks existants
Évaluation des 向量模型 sur JinaVDR
Intégration MTEB
Limitations
Conclusion
Mise à jour logicielle
juillet 25, 2025

JinaVDR : Nouvelle référence d'évaluation pour la recherche de documents visuels avec 95 tâches dans 20 langues

JinaVDR est une nouvelle référence comprenant 95 tâches dans 20 langues pour la recherche de documents visuels, bientôt disponible sur MTEB.
Maximilian Werk, Alex C-G • 8 minutes lues
GitHub - jina-ai/jina-vdr: Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval
Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval - jina-ai/jina-vdr
GitHubjina-ai
JinaVDR (Visual Document Retrieval) - a jinaai Collection
max. ~1000 images and OCR text included
a jinaai Collection

Nous lançons JinaVDR (Visual Document Retrieval), un nouveau benchmark pour évaluer la performance des modèles dans la récupération de documents visuellement complexes. JinaVDR englobe des documents multilingues avec des mises en page complexes, combinant des graphiques, des tableaux, du texte et des images, ainsi que des copies numérisées et des captures d'écran. Le benchmark associe ces divers documents visuels à des requêtes textuelles ciblées, permettant une évaluation complète des performances de récupération dans des conditions de complexité documentaire réelle et une couverture de domaine plus large.

Benchmark Objectif de la tâche Langues Nombre de tâches
JinaVDR Documents visuellement riches 20 langues 95
MIEB Principalement des images naturelles 38 langues 130
ViDoRe v1 Documents visuellement riches Anglais 5
ViDoRe v2 Documents visuellement riches Anglais, Français, Espagnol, Allemand 4
Statistiques de JinaVDR, montrant les langues des requêtes et des documents, les domaines et les formats de documents

JinaVDR couvre divers langues, domaines et formats de documents pour refléter les scénarios de récupération réels. Bien que l'anglais reste prédominant dans les requêtes et les documents, le benchmark incorpore plus d'une douzaine de langues supplémentaires, offrant une couverture multilingue significativement plus large. Les domaines englobent les documents historiques, la documentation logicielle, les dossiers médicaux, les textes juridiques et les articles scientifiques, capturant divers cas d'utilisation professionnels. Les formats de documents varient des pages web et des PDF aux documents numérisés, en passant par les diapositives de présentation et les images autonomes. De nombreux ensembles de données mélangent intentionnellement les langues et les formats, créant des conditions réalistes qui mettent les modèles au défi de gérer la complexité qu'ils rencontrent dans les applications pratiques.

tagComment nous avons construit JinaVDR

Le benchmark JinaVDR fournit un cadre d'évaluation couvrant 95 tâches dans 20 langues, y compris des documents riches en domaines et en mises en page tels que des graphiques, des cartes, des documents numérisés traditionnels, des fichiers Markdown et des tableaux complexes. Il évalue les modèles à travers à la fois des questions-réponses visuelles (par exemple, « Combien de poursuites civiles ont été rejetées à l'audience de Valladolid en 1855 ? ») et des requêtes par mots-clés (par exemple, « croissance du marché des LED dans différentes régions »), donnant une évaluation plus claire des capacités de récupération sur différents types de documents trouvés dans le monde réel.

Nous avons utilisé quatre techniques pour construire JinaVDR en nous concentrant sur la diversité des données et l'authenticité des tâches :

Premièrement, nous avons réaffecté des benchmarks existants en convertissant des ensembles de données OCR en tâches de récupération à l'aide de modèles de requête basés sur des règles (par exemple, en transformant les données MPMQA) et en reformattant les ensembles de données de questions-réponses en scénarios de récupération :

Exemple de document MPMQA et de requête du benchmark JinaVDR

Deuxièmement, nous avons annoté manuellement les ensembles de données PDF existants, y compris StanfordSlides, TextbookQA et ShanghaiMasterPlan, pour créer des paires de récupération de haute qualité :

Exemple de document StanfordSlides et de requête du benchmark JinaVDR

Notre troisième approche impliquait la génération synthétique de requêtes et/ou de documents, où nous avons utilisé des collections de documents existantes provenant de sources telles que Europeana pour créer des requêtes contextuellement pertinentes avec Qwen2-VL-7B-Instruct, ainsi que des descriptions textuelles EasyOCR :

Exemple de document Europeana et de requête du benchmark JinaVDR, y compris la traduction anglaise de la requête pour référence

Nous avons également rendu des ensembles de données tabulaires en tableaux visuels et généré des requêtes correspondantes via des modèles dérivés des données textuelles originales, comme démontré dans notre tâche AirBnBRetrieval.

Enfin, nous avons réaffecté des ensembles de données explorés existants avec des paires article-graphique, où nous utilisons des extraits de texte des articles comme requêtes et les graphiques correspondants comme documents cibles, comme le montre notre ensemble de données OWIDRetrieval :

Exemple de document OWIDRetrieval et de requête du benchmark JinaVDR

Cette approche à multiples facettes nous offre une couverture complète des types de documents, des langues et des scénarios de récupération.

tagBenchmarks existants

Le développement de modèles véritablement multimodaux (capables de gérer des documents visuellement complexes) nécessite des benchmarks qui vont au-delà des méthodes d'évaluation traditionnelles basées uniquement sur du texte. Les cadres tels que MTEB (Massive Text Embedding Benchmark) peuvent bien fonctionner pour évaluer la récupération de texte dans différents domaines et langues, mais ils ne sont pas conçus pour la recherche dans des documents où une récupération précise dépend de la mise en page visuelle, des graphiques, des tableaux et du formatage. C'est là que les benchmarks de récupération de documents visuels (comme la série ViDoRe) et les benchmarks de récupération d'images (comme MIEB, le Massive Image Embedding Benchmark) entrent en jeu.

L'article ColPali paper a introduit ViDoRe v1, qui combine cinq ensembles de données en langue anglaise, à la fois académiques et synthétiques. Le benchmark se concentre sur les documents d'une seule page qui fonctionnent bien avec la reconnaissance optique de caractères (OCR), couvre des domaines étroits comme les articles scientifiques et les soins de santé, et utilise des requêtes extractives où les termes de recherche apparaissent souvent directement dans les documents cibles.

Exemples de l'ensemble de données de benchmark ViDoRe v1

Après que des modèles comme ColPali ont atteint un score de 90 % nDCG@5 sur ViDoRe v1, un nouveau benchmark était nécessaire. ViDoRe v2 s'est amélioré par rapport à v1 en prenant en charge des requêtes plus longues et inter-documents, des requêtes contextuelles aveugles et plus de langues (français, allemand et espagnol en plus de l'anglais). Les deux benchmarks ont encore une diversité linguistique limitée et une couverture de domaine étroite, laissant des lacunes pour l'évaluation des nouveaux systèmes de récupération.

Exemples tirés de l'ensemble de données de référence ViDoRe v2

Le MIEB adopte une approche différente en se concentrant sur les 向量模型 visuels à travers 130 tâches, y compris d'autres tâches au-delà de la simple récupération. Cependant, il évalue principalement des images sans beaucoup de contenu textuel, plutôt que des documents visuellement riches. Bien que le benchmark soit excellent pour tester les capacités de compréhension visuelle, il ne fonctionne pas bien lorsque vous devez récupérer des documents en fonction de la mise en page visuelle et du contenu textuel.

Exemples tirés du benchmark MIEB

Notre objectif avec le benchmark JinaVDR (Visual Document Retrieval) est de développer le travail de ces benchmarks précédents en incorporant des documents multilingues visuellement riches avec des mises en page complexes comme des graphiques, des diagrammes et des tableaux (mélangés à du texte et des images), ainsi qu'en ajoutant des requêtes et des questions du monde réel.

tagÉvaluation des 向量模型 sur JinaVDR

💡
Vous pouvez exécuter le benchmark vous-même avec le code sur notre dépôt GitHub.

Nos résultats de benchmarking montrent que de nombreux modèles de 向量模型 récents ont du mal avec le large éventail de tâches de documents visuels de JinaVDR, tandis que les références basées sur l'OCR et les modèles plus anciens affichent des résultats encore plus faibles, en particulier sur les ensembles de données non anglais et de documents structurés. Nous avons inclus BM25 avec OCR pour tous les ensembles de données où une simple extraction de texte rendait cette récupération possible.

Une exception à cela est jina-embeddings-v4. Nos résultats suggèrent que son approche de 向量模型 multimodal gère mieux la récupération de documents complexes et multilingues que les modèles de génération antérieurs ou les pipelines traditionnels basés sur l'OCR. La capacité multi-vecteurs du modèle offre les meilleures performances car elle évite les limitations de compression des approches à vecteur unique — alors que les vecteurs uniques doivent entasser le contenu d'une page entière dans une seule représentation (ce qui rend difficile la capture de détails spécifiques), l'approche multi-vecteurs conserve les informations granulaires nécessaires à une récupération précise de documents similaires.

Figure 9 : Performances du modèle sur le benchmark JinaVDR, en moyenne sur toutes les tâches
Average medical-prescriptions DonutVQA TableVQA europeana-de-news europeana-es-news europeana-it-scans europeana-nl-legal hindi-gov-vqa jdocqa_jp wikimedia-commons-documents (ar) github-readme-retrieval-ml-filtered (ru)
BM25 + OCR 26.67% 38.18% 19.39% 35.64% 11.26% 51.99% 39.11% 34.97% 1.83% 1.64% 19.60% 39.78%
jina-embeddings-v3 + OCR 27.49% 37.25% 2.60% 34.24% 12.05% 44.03% 38.69% 29.07% 7.52% 7.79% 38.06% 51.07%
jina-clip-v2 17.79% 15.66% 1.63% 21.06% 11.19% 13.14% 16.23% 9.79% 5.02% 19.91% 45.29% 36.80%
colpali-v1.2 46.44% 83.91% 32.53% 54.66% 34.64% 44.74% 54.32% 30.89% 13.04% 39.45% 41.96% 80.67%
colqwen2-v0.1 58.26% 77.72% 46.34% 57.52% 53.42% 74.28% 71.23% 46.13% 20.53% 74.38% 36.94% 0.82388
MrLight/dse-qwen2-2b-mrl-v1 47.95% 38.22% 25.31% 57.39% 44.75% 60.58% 53.92% 29.50% 9.80% 66.73% 62.47% 78.77%
jina-embeddings-v4 (single-vector) 61.39% 81.17% 78.48% 58.90% 49.05% 60.10% 57.88% 37.14% 15.40% 75.57% 72.07% 89.55%
jina-embeddings-v4 (multivector) 70.89% 97.95% 73.55% 60.91% 65.65% 80.58% 73.14% 54.15% 21.94% 82.34% 81.19% 88.39%

tagIntégration MTEB

dataset: Add JinaVDR by maximilianwerk · Pull Request #2942 · embeddings-benchmark/mteb
Hey, we would like to contribute the JinaVDR benchmark to MTEB. Our aim with the JinaVDR (Visual Document Retrieval) benchmark is to expand upon the work of these prior benchmarks by incorporating…
GitHubembeddings-benchmark

Étant donné que MTEB est devenu la norme de facto pour le benchmarking de la récupération, nous intégrons JinaVDR directement dans le framework MTEB pour maximiser l'adoption et la facilité d'utilisation. Cela permet aux chercheurs d'exécuter plus facilement des modèles de récupération visuelle sur notre benchmark en utilisant une infrastructure d'évaluation familière. Cependant, la migration de nos données vers le format BEIR a nécessité des compromis, comme le fait de ne pas inclure les résultats OCR dans la version MTEB. Cela signifie que les méthodes traditionnelles basées sur le texte comme BM25 ne sont pas directement exécutables dans le cadre de MTEB, ce qui renforce l'accent mis sur la compréhension des documents visuels plutôt que de se rabattre sur des méthodes de récupération basées sur le texte.

tagLimitations

Pour construire un benchmark complet à partir d'un large éventail de sources, nous avons dû effectuer un prétraitement minutieux pour garantir à la fois la convivialité pratique et la qualité de l'évaluation : Nous avons appliqué une normalisation de la taille en sous-échantillonnant chaque ensemble de données à un maximum de 1 000 exemples (contre des milliers ou des dizaines de milliers), ce qui rend le benchmark réellement exécutable tout en maintenant une bonne couverture des tâches. Cette contrainte était particulièrement importante étant donné les niveaux élevés de calcul dont nous avions besoin pour traiter des documents visuels haute résolution.

Nous avons utilisé un filtrage de la qualité pour répondre à plusieurs défis courants dans les collections de documents du monde réel. Bien que la mauvaise qualité d'image dans les documents numérisés reflète souvent des cas d'utilisation réalistes, elle a rendu plus difficile le contrôle de la qualité des données synthétiques. Nous avons mis en œuvre un filtrage de la cohérence pour supprimer les doublons (qui sont courants dans les grandes collections de documents) et utilisé des 大模型 pour filtrer les requêtes de faible qualité qui ne fourniraient pas de signaux d'évaluation utiles, telles que les questions trop génériques comme "What can you see in the chart?". Pour la génération de données synthétiques, nous avons rencontré des limitations dans la diversité des requêtes malgré l'utilisation de stratégies de 提示词 variées, et nous avons dû effectuer une curation manuelle pour garantir une couverture d'évaluation suffisante dans différents scénarios de récupération.

tagConclusion

L'évaluation de la récupération de documents visuels se trouve maintenant dans une situation où les benchmarks traditionnels basés sur le texte ne capturent plus la complexité de la façon dont les humains recherchent et consomment réellement l'information. JinaVDR surmonte cet obstacle en fournissant une évaluation complète sur un éventail de tâches et de langues dépassant de loin les benchmarks précédents.

Pour l'avenir, l'industrie a besoin de benchmarks qui reflètent de véritables défis de récupération plutôt que des contraintes artificielles. Au fur et à mesure que les organisations s'appuient davantage sur la récupération de documents visuels pour des tâches allant de la recherche juridique aux diagnostics médicaux, les frameworks d'évaluation doivent évoluer au-delà des ensembles de données académiques étroits vers les documents désordonnés, multilingues et visuellement complexes que nous trouvons dans le monde réel. JinaVDR n'est que la première étape dans la construction de systèmes de récupération qui comprennent vraiment comment l'information visuelle et textuelle fonctionnent ensemble dans la pratique.

Catégories:
Mise à jour logicielle
rss_feed

En savoir plus
mars 18, 2024 • 7 minutes lues
Optimisez avec PromptPerfect : Nouveaux choix d'abonnements & Optimiseur interactif de pointe
Alex C-G
Andrei Ungureanu
Logo with gradient blue-purple background, wave pattern, "v1.0" text, and abstract multicolored shapes at the forefront.
juin 30, 2025 • 8 minutes lues
Formation tenant compte de la quantification de jina-embeddings-v4
Andrei Ungureanu
Scott Martens
Bo Wang
Retro-style digital screen displaying four pixelated images: a cat, a woman, an abstract figure, and a man's portrait, with l
juin 25, 2025 • 12 minutes lues
Jina Embeddings v4 : Vecteurs universels pour la recherche multimodale et multilingue
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.