Estamos lanzando JinaVDR (Visual Document Retrieval, Recuperación de Documentos Visuales), un nuevo punto de referencia para evaluar qué tan bien los modelos recuperan documentos visualmente complejos. JinaVDR abarca documentos multilingües con diseños intrincados, que combinan gráficos, diagramas, tablas, texto e imágenes junto con copias escaneadas y capturas de pantalla. El punto de referencia empareja estos diversos documentos visuales con consultas de texto dirigidas, lo que permite una evaluación integral del rendimiento de la recuperación en la complejidad de los documentos del mundo real y una cobertura de dominio más amplia.
| Benchmark | Enfoque de la tarea | Idiomas | Número de tareas |
|---|---|---|---|
| JinaVDR | Documentos visualmente ricos | 20 idiomas | 95 |
| MIEB | Principalmente imágenes naturales | 38 idiomas | 130 |
| ViDoRe v1 | Documentos visualmente ricos | Inglés | 5 |
| ViDoRe v2 | Documentos visualmente ricos | Inglés, francés, español, alemán | 4 |

JinaVDR abarca diversos idiomas, dominios y formatos de documentos para reflejar escenarios de recuperación del mundo real. Si bien el inglés sigue siendo predominante tanto en las consultas como en los documentos, el punto de referencia incorpora más de una docena de idiomas adicionales, lo que proporciona una cobertura multilingüe significativamente más amplia. Los dominios abarcan documentos históricos, documentación de software, registros médicos, textos legales y artículos científicos, capturando diversos casos de uso profesionales. Los formatos de documentos varían desde páginas web y archivos PDF hasta materiales escaneados, diapositivas de presentación e imágenes independientes. Muchos conjuntos de datos mezclan intencionalmente idiomas y formatos, creando condiciones realistas que desafían a los modelos a manejar la complejidad que encuentran en las aplicaciones prácticas.
tagCómo construimos JinaVDR
El punto de referencia JinaVDR proporciona un marco de evaluación que abarca 95 tareas en 20 idiomas, incluidos documentos con diversidad de dominios y ricos en diseños, como gráficos, mapas, documentos escaneados tradicionales, archivos Markdown y tablas complejas. Evalúa los modelos a través de preguntas y respuestas visuales (por ejemplo, “How many civil lawsuits were dismissed at the Valladolid audience in 1855?”) y consultas de palabras clave (por ejemplo, “growth of the LED market across different regions”), lo que proporciona una evaluación más clara de las capacidades de recuperación en diferentes tipos de documentos que se encuentran en el mundo real.
Utilizamos cuatro técnicas para construir JinaVDR con un enfoque en la diversidad de datos y la autenticidad de las tareas:
Primero, reutilizamos los puntos de referencia existentes convirtiendo los conjuntos de datos OCR en tareas de recuperación utilizando plantillas de consulta basadas en reglas (como transformar los datos de MPMQA) y reformateando los conjuntos de datos de preguntas y respuestas en escenarios de recuperación:

En segundo lugar, anotamos manualmente los conjuntos de datos PDF existentes, incluidos StanfordSlides, TextbookQA y ShanghaiMasterPlan, para crear pares de recuperación de alta calidad:

Nuestro tercer enfoque implicó la generación sintética de consultas y/o documentos, donde utilizamos colecciones de documentos existentes de fuentes como Europeana para crear consultas contextualmente relevantes con Qwen2-VL-7B-Instruct, junto con descripciones de texto EasyOCR:

También renderizamos conjuntos de datos tabulares en tablas visuales y generamos las consultas correspondientes a través de plantillas derivadas de los datos de texto originales, como se demuestra en nuestra tarea AirBnBRetrieval.
Finalmente, reutilizamos los conjuntos de datos rastreados existentes con pares de artículo-gráfico, donde utilizamos fragmentos de texto de los artículos como consultas y los gráficos correspondientes como documentos de destino, como se muestra en nuestro conjunto de datos OWIDRetrieval:

Este enfoque multifacético nos brinda una cobertura integral de los tipos de documentos, los idiomas y los escenarios de recuperación.
tagPuntos de referencia existentes
El desarrollo de modelos verdaderamente multimodales (que puedan manejar documentos visualmente complejos) requiere puntos de referencia que vayan más allá de los métodos de evaluación tradicionales basados únicamente en texto. Los marcos como MTEB (Massive Text Embedding Benchmark) pueden funcionar bien para evaluar la recuperación de texto en diferentes dominios e idiomas, pero no están diseñados para buscar en documentos donde la recuperación precisa depende del diseño visual, los gráficos, las tablas y el formato. Aquí es donde entran los puntos de referencia de recuperación de documentos visuales (como la serie ViDoRe) y los puntos de referencia de recuperación de imágenes (como MIEB, Massive Image Embedding Benchmark).
El artículo de ColPali introdujo ViDoRe v1, que combina cinco conjuntos de datos en inglés, tanto académicos como sintéticos. El punto de referencia se centra en documentos de una sola página que funcionan bien con el reconocimiento óptico de caracteres (OCR), cubre dominios estrechos como artículos científicos y atención médica, y utiliza consultas extractivas donde los términos de búsqueda a menudo aparecen directamente en los documentos de destino.

Después de que modelos como ColPali alcanzaron una puntuación del 90% nDCG@5 en ViDoRe v1, se necesitó un nuevo punto de referencia. ViDoRe v2 mejoró v1 al admitir consultas más largas y entre documentos, consultas contextuales ciegas y más idiomas (francés, alemán y español además del inglés). Ambos puntos de referencia aún tienen una diversidad lingüística limitada y una cobertura de dominio estrecha, lo que deja lagunas para evaluar nuevos sistemas de recuperación.

El MIEB adopta un enfoque diferente al centrarse en los embeddings visuales en 130 tareas, incluidas otras tareas más allá de la simple recuperación. Sin embargo, evalúa principalmente imágenes sin mucho contenido de texto, en lugar de documentos visualmente ricos. Si bien el punto de referencia es excelente para probar las capacidades de comprensión visual, no funciona bien cuando se necesita recuperar documentos basados en el diseño visual y el contenido textual.

Nuestro objetivo con el punto de referencia JinaVDR (Recuperación de Documentos Visuales) es ampliar el trabajo de estos puntos de referencia anteriores mediante la incorporación de documentos multilingües visualmente ricos con diseños complejos como gráficos, diagramas y tablas (mezclados con texto e imágenes), así como la adición de consultas y preguntas del mundo real.
tagEvaluación de Embeddings en JinaVDR
Nuestros resultados de evaluación comparativa muestran que muchos modelos de embeddings recientes tienen dificultades con la amplia gama de tareas de documentos visuales de JinaVDR, mientras que las líneas de base basadas en OCR y los modelos más antiguos muestran resultados aún más débiles, especialmente en conjuntos de datos de documentos estructurados y no en inglés. Incluimos BM25 con OCR para todos los conjuntos de datos donde la extracción de texto simple hacía factible dicha recuperación.
Una excepción a esto es jina-embeddings-v4. Nuestros resultados sugieren que su enfoque de embeddings multimodal maneja la recuperación de documentos complejos y multilingües mejor que los modelos de generación anteriores o las canalizaciones tradicionales basadas en OCR. La capacidad multi-vector del modelo proporciona el mejor rendimiento porque evita las limitaciones de compresión de los enfoques de un solo vector; mientras que los vectores individuales tienen que comprimir el contenido de una página completa en una sola representación (lo que dificulta la captura de detalles específicos), el enfoque multi-vector mantiene la información granular necesaria para la recuperación precisa de documentos similares.

| Promedio | medical-prescriptions | DonutVQA | TableVQA | europeana-de-news | europeana-es-news | europeana-it-scans | europeana-nl-legal | hindi-gov-vqa | jdocqa_jp | wikimedia-commons-documents (ar) | github-readme-retrieval-ml-filtered (ru) | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BM25 + OCR | 26.67% | 38.18% | 19.39% | 35.64% | 11.26% | 51.99% | 39.11% | 34.97% | 1.83% | 1.64% | 19.60% | 39.78% |
jina-embeddings-v3 + OCR |
27.49% | 37.25% | 2.60% | 34.24% | 12.05% | 44.03% | 38.69% | 29.07% | 7.52% | 7.79% | 38.06% | 51.07% |
| jina-clip-v2 | 17.79% | 15.66% | 1.63% | 21.06% | 11.19% | 13.14% | 16.23% | 9.79% | 5.02% | 19.91% | 45.29% | 36.80% |
colpali-v1.2 |
46.44% | 83.91% | 32.53% | 54.66% | 34.64% | 44.74% | 54.32% | 30.89% | 13.04% | 39.45% | 41.96% | 80.67% |
colqwen2-v0.1 |
58.26% | 77.72% | 46.34% | 57.52% | 53.42% | 74.28% | 71.23% | 46.13% | 20.53% | 74.38% | 36.94% | 0.82388 |
MrLight/dse-qwen2-2b-mrl-v1 |
47.95% | 38.22% | 25.31% | 57.39% | 44.75% | 60.58% | 53.92% | 29.50% | 9.80% | 66.73% | 62.47% | 78.77% |
jina-embeddings-v4 (single-vector) |
61.39% | 81.17% | 78.48% | 58.90% | 49.05% | 60.10% | 57.88% | 37.14% | 15.40% | 75.57% | 72.07% | 89.55% |
jina-embeddings-v4 (multivector) |
70.89% | 97.95% | 73.55% | 60.91% | 65.65% | 80.58% | 73.14% | 54.15% | 21.94% | 82.34% | 81.19% | 88.39% |
tagIntegración de MTEB
Dado que MTEB se ha convertido en el estándar de facto para la evaluación comparativa de la recuperación, estamos integrando JinaVDR directamente en el marco MTEB para maximizar la adopción y la facilidad de uso. Esto facilita a los investigadores la ejecución de modelos de recuperación visual en nuestro punto de referencia utilizando una infraestructura de evaluación familiar. Sin embargo, la migración de nuestros datos al formato BEIR requirió algunas concesiones, como no incluir los resultados de OCR en la versión MTEB. Esto significa que los métodos tradicionales basados en texto como BM25 no se pueden ejecutar directamente como parte del MTEB, lo que refuerza el enfoque en la comprensión de documentos visuales en lugar de recurrir a métodos de recuperación basados en texto.
tagLimitaciones
Para construir un punto de referencia integral a partir de una amplia gama de fuentes, tuvimos que realizar un preprocesamiento cuidadoso para garantizar tanto la usabilidad práctica como la calidad de la evaluación: Aplicamos la normalización de tamaño al submuestrear cada conjunto de datos a un máximo de 1000 ejemplos (en comparación con miles o decenas de miles), lo que hizo que el punto de referencia fuera realmente ejecutable al tiempo que mantenía una buena cobertura en todas las tareas. Esta restricción fue especialmente importante dados los altos niveles de computación que necesitábamos para procesar documentos visuales de alta resolución.
Utilizamos el filtrado de calidad para abordar varios desafíos comunes en las colecciones de documentos del mundo real. Si bien la mala calidad de la imagen en los documentos escaneados a menudo refleja casos de uso realistas, dificultó el control de la calidad de los datos sintéticos. Implementamos el filtrado de coherencia para eliminar duplicados (que son comunes en las grandes colecciones de documentos) y utilizamos LLM para filtrar consultas de baja calidad que no proporcionarían señales de evaluación útiles, como preguntas demasiado genéricas como "¿Qué puedes ver en el gráfico?". Para la generación de datos sintéticos, encontramos limitaciones en la diversidad de consultas a pesar de utilizar diversas estrategias de prompting, y necesitamos realizar una curación manual para garantizar una cobertura de evaluación suficiente en diferentes escenarios de recuperación.
tagConclusión
La evaluación de la recuperación de documentos visuales se encuentra ahora en una situación en la que los puntos de referencia tradicionales basados en texto ya no capturan la complejidad de cómo los humanos realmente buscan y consumen información. JinaVDR supera esta barrera al proporcionar una evaluación integral en una gama de tareas e idiomas que supera con creces los puntos de referencia anteriores.
En el futuro, la industria necesita puntos de referencia que reflejen los desafíos de recuperación genuinos en lugar de las limitaciones artificiales. A medida que las organizaciones confían más en la recuperación de documentos visuales para tareas que van desde la investigación legal hasta el diagnóstico médico, los marcos de evaluación deben evolucionar más allá de los conjuntos de datos académicos estrechos hacia los documentos desordenados, multilingües y visualmente complejos que encontramos en el mundo real. JinaVDR es solo el primer paso en la construcción de sistemas de recuperación que realmente comprendan cómo la información visual y textual trabajan juntas en la práctica.







