Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyAgentesdata_objectEsquemamenu_bookDocumentos



Acceso
login
Cómo construimos JinaVDR
Puntos de referencia existentes
Evaluación de Embeddings en JinaVDR
Integración de MTEB
Limitaciones
Conclusión
Actualización de software
julio 25, 2025

JinaVDR: Nuevo benchmark de recuperación visual de documentos con 95 tareas en 20 idiomas

JinaVDR es un nuevo benchmark que abarca 95 tareas en 20 idiomas para la recuperación visual de documentos, y pronto estará disponible en MTEB.
Maximilian Werk, Alex C-G • 8 minutos de lectura
GitHub - jina-ai/jina-vdr: Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval
Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval - jina-ai/jina-vdr
GitHubjina-ai
JinaVDR (Visual Document Retrieval) - a jinaai Collection
max. ~1000 images and OCR text included
a jinaai Collection

Estamos lanzando JinaVDR (Visual Document Retrieval, Recuperación de Documentos Visuales), un nuevo punto de referencia para evaluar qué tan bien los modelos recuperan documentos visualmente complejos. JinaVDR abarca documentos multilingües con diseños intrincados, que combinan gráficos, diagramas, tablas, texto e imágenes junto con copias escaneadas y capturas de pantalla. El punto de referencia empareja estos diversos documentos visuales con consultas de texto dirigidas, lo que permite una evaluación integral del rendimiento de la recuperación en la complejidad de los documentos del mundo real y una cobertura de dominio más amplia.

Benchmark Enfoque de la tarea Idiomas Número de tareas
JinaVDR Documentos visualmente ricos 20 idiomas 95
MIEB Principalmente imágenes naturales 38 idiomas 130
ViDoRe v1 Documentos visualmente ricos Inglés 5
ViDoRe v2 Documentos visualmente ricos Inglés, francés, español, alemán 4
Estadísticas de JinaVDR, que muestran los idiomas de consulta/documento, los dominios y los formatos de documento

JinaVDR abarca diversos idiomas, dominios y formatos de documentos para reflejar escenarios de recuperación del mundo real. Si bien el inglés sigue siendo predominante tanto en las consultas como en los documentos, el punto de referencia incorpora más de una docena de idiomas adicionales, lo que proporciona una cobertura multilingüe significativamente más amplia. Los dominios abarcan documentos históricos, documentación de software, registros médicos, textos legales y artículos científicos, capturando diversos casos de uso profesionales. Los formatos de documentos varían desde páginas web y archivos PDF hasta materiales escaneados, diapositivas de presentación e imágenes independientes. Muchos conjuntos de datos mezclan intencionalmente idiomas y formatos, creando condiciones realistas que desafían a los modelos a manejar la complejidad que encuentran en las aplicaciones prácticas.

tagCómo construimos JinaVDR

El punto de referencia JinaVDR proporciona un marco de evaluación que abarca 95 tareas en 20 idiomas, incluidos documentos con diversidad de dominios y ricos en diseños, como gráficos, mapas, documentos escaneados tradicionales, archivos Markdown y tablas complejas. Evalúa los modelos a través de preguntas y respuestas visuales (por ejemplo, “How many civil lawsuits were dismissed at the Valladolid audience in 1855?”) y consultas de palabras clave (por ejemplo, “growth of the LED market across different regions”), lo que proporciona una evaluación más clara de las capacidades de recuperación en diferentes tipos de documentos que se encuentran en el mundo real.

Utilizamos cuatro técnicas para construir JinaVDR con un enfoque en la diversidad de datos y la autenticidad de las tareas:

Primero, reutilizamos los puntos de referencia existentes convirtiendo los conjuntos de datos OCR en tareas de recuperación utilizando plantillas de consulta basadas en reglas (como transformar los datos de MPMQA) y reformateando los conjuntos de datos de preguntas y respuestas en escenarios de recuperación:

Documento y consulta de muestra de MPMQA del punto de referencia JinaVDR

En segundo lugar, anotamos manualmente los conjuntos de datos PDF existentes, incluidos StanfordSlides, TextbookQA y ShanghaiMasterPlan, para crear pares de recuperación de alta calidad:

Documento y consulta de muestra de StanfordSlides del punto de referencia JinaVDR

Nuestro tercer enfoque implicó la generación sintética de consultas y/o documentos, donde utilizamos colecciones de documentos existentes de fuentes como Europeana para crear consultas contextualmente relevantes con Qwen2-VL-7B-Instruct, junto con descripciones de texto EasyOCR:

Documento y consulta de muestra de Europeana del punto de referencia JinaVDR, incluida la traducción de la consulta al inglés como referencia

También renderizamos conjuntos de datos tabulares en tablas visuales y generamos las consultas correspondientes a través de plantillas derivadas de los datos de texto originales, como se demuestra en nuestra tarea AirBnBRetrieval.

Finalmente, reutilizamos los conjuntos de datos rastreados existentes con pares de artículo-gráfico, donde utilizamos fragmentos de texto de los artículos como consultas y los gráficos correspondientes como documentos de destino, como se muestra en nuestro conjunto de datos OWIDRetrieval:

Documento y consulta de muestra de OWIDRetrieval del punto de referencia JinaVDR

Este enfoque multifacético nos brinda una cobertura integral de los tipos de documentos, los idiomas y los escenarios de recuperación.

tagPuntos de referencia existentes

El desarrollo de modelos verdaderamente multimodales (que puedan manejar documentos visualmente complejos) requiere puntos de referencia que vayan más allá de los métodos de evaluación tradicionales basados únicamente en texto. Los marcos como MTEB (Massive Text Embedding Benchmark) pueden funcionar bien para evaluar la recuperación de texto en diferentes dominios e idiomas, pero no están diseñados para buscar en documentos donde la recuperación precisa depende del diseño visual, los gráficos, las tablas y el formato. Aquí es donde entran los puntos de referencia de recuperación de documentos visuales (como la serie ViDoRe) y los puntos de referencia de recuperación de imágenes (como MIEB, Massive Image Embedding Benchmark).

El artículo de ColPali introdujo ViDoRe v1, que combina cinco conjuntos de datos en inglés, tanto académicos como sintéticos. El punto de referencia se centra en documentos de una sola página que funcionan bien con el reconocimiento óptico de caracteres (OCR), cubre dominios estrechos como artículos científicos y atención médica, y utiliza consultas extractivas donde los términos de búsqueda a menudo aparecen directamente en los documentos de destino.

Muestras del conjunto de datos de referencia ViDoRe v1

Después de que modelos como ColPali alcanzaron una puntuación del 90% nDCG@5 en ViDoRe v1, se necesitó un nuevo punto de referencia. ViDoRe v2 mejoró v1 al admitir consultas más largas y entre documentos, consultas contextuales ciegas y más idiomas (francés, alemán y español además del inglés). Ambos puntos de referencia aún tienen una diversidad lingüística limitada y una cobertura de dominio estrecha, lo que deja lagunas para evaluar nuevos sistemas de recuperación.

Muestras del conjunto de datos de referencia ViDoRe v2

El MIEB adopta un enfoque diferente al centrarse en los embeddings visuales en 130 tareas, incluidas otras tareas más allá de la simple recuperación. Sin embargo, evalúa principalmente imágenes sin mucho contenido de texto, en lugar de documentos visualmente ricos. Si bien el punto de referencia es excelente para probar las capacidades de comprensión visual, no funciona bien cuando se necesita recuperar documentos basados en el diseño visual y el contenido textual.

Muestras del punto de referencia MIEB

Nuestro objetivo con el punto de referencia JinaVDR (Recuperación de Documentos Visuales) es ampliar el trabajo de estos puntos de referencia anteriores mediante la incorporación de documentos multilingües visualmente ricos con diseños complejos como gráficos, diagramas y tablas (mezclados con texto e imágenes), así como la adición de consultas y preguntas del mundo real.

tagEvaluación de Embeddings en JinaVDR

💡
Puede ejecutar el punto de referencia por sí mismo con el código en nuestro repositorio de GitHub.

Nuestros resultados de evaluación comparativa muestran que muchos modelos de embeddings recientes tienen dificultades con la amplia gama de tareas de documentos visuales de JinaVDR, mientras que las líneas de base basadas en OCR y los modelos más antiguos muestran resultados aún más débiles, especialmente en conjuntos de datos de documentos estructurados y no en inglés. Incluimos BM25 con OCR para todos los conjuntos de datos donde la extracción de texto simple hacía factible dicha recuperación.

Una excepción a esto es jina-embeddings-v4. Nuestros resultados sugieren que su enfoque de embeddings multimodal maneja la recuperación de documentos complejos y multilingües mejor que los modelos de generación anteriores o las canalizaciones tradicionales basadas en OCR. La capacidad multi-vector del modelo proporciona el mejor rendimiento porque evita las limitaciones de compresión de los enfoques de un solo vector; mientras que los vectores individuales tienen que comprimir el contenido de una página completa en una sola representación (lo que dificulta la captura de detalles específicos), el enfoque multi-vector mantiene la información granular necesaria para la recuperación precisa de documentos similares.

Figura 9: Rendimiento del modelo en el punto de referencia JinaVDR, promediado en todas las tareas
Promedio medical-prescriptions DonutVQA TableVQA europeana-de-news europeana-es-news europeana-it-scans europeana-nl-legal hindi-gov-vqa jdocqa_jp wikimedia-commons-documents (ar) github-readme-retrieval-ml-filtered (ru)
BM25 + OCR 26.67% 38.18% 19.39% 35.64% 11.26% 51.99% 39.11% 34.97% 1.83% 1.64% 19.60% 39.78%
jina-embeddings-v3 + OCR 27.49% 37.25% 2.60% 34.24% 12.05% 44.03% 38.69% 29.07% 7.52% 7.79% 38.06% 51.07%
jina-clip-v2 17.79% 15.66% 1.63% 21.06% 11.19% 13.14% 16.23% 9.79% 5.02% 19.91% 45.29% 36.80%
colpali-v1.2 46.44% 83.91% 32.53% 54.66% 34.64% 44.74% 54.32% 30.89% 13.04% 39.45% 41.96% 80.67%
colqwen2-v0.1 58.26% 77.72% 46.34% 57.52% 53.42% 74.28% 71.23% 46.13% 20.53% 74.38% 36.94% 0.82388
MrLight/dse-qwen2-2b-mrl-v1 47.95% 38.22% 25.31% 57.39% 44.75% 60.58% 53.92% 29.50% 9.80% 66.73% 62.47% 78.77%
jina-embeddings-v4 (single-vector) 61.39% 81.17% 78.48% 58.90% 49.05% 60.10% 57.88% 37.14% 15.40% 75.57% 72.07% 89.55%
jina-embeddings-v4 (multivector) 70.89% 97.95% 73.55% 60.91% 65.65% 80.58% 73.14% 54.15% 21.94% 82.34% 81.19% 88.39%

tagIntegración de MTEB

dataset: Add JinaVDR by maximilianwerk · Pull Request #2942 · embeddings-benchmark/mteb
Hey, we would like to contribute the JinaVDR benchmark to MTEB. Our aim with the JinaVDR (Visual Document Retrieval) benchmark is to expand upon the work of these prior benchmarks by incorporating…
GitHubembeddings-benchmark

Dado que MTEB se ha convertido en el estándar de facto para la evaluación comparativa de la recuperación, estamos integrando JinaVDR directamente en el marco MTEB para maximizar la adopción y la facilidad de uso. Esto facilita a los investigadores la ejecución de modelos de recuperación visual en nuestro punto de referencia utilizando una infraestructura de evaluación familiar. Sin embargo, la migración de nuestros datos al formato BEIR requirió algunas concesiones, como no incluir los resultados de OCR en la versión MTEB. Esto significa que los métodos tradicionales basados en texto como BM25 no se pueden ejecutar directamente como parte del MTEB, lo que refuerza el enfoque en la comprensión de documentos visuales en lugar de recurrir a métodos de recuperación basados en texto.

tagLimitaciones

Para construir un punto de referencia integral a partir de una amplia gama de fuentes, tuvimos que realizar un preprocesamiento cuidadoso para garantizar tanto la usabilidad práctica como la calidad de la evaluación: Aplicamos la normalización de tamaño al submuestrear cada conjunto de datos a un máximo de 1000 ejemplos (en comparación con miles o decenas de miles), lo que hizo que el punto de referencia fuera realmente ejecutable al tiempo que mantenía una buena cobertura en todas las tareas. Esta restricción fue especialmente importante dados los altos niveles de computación que necesitábamos para procesar documentos visuales de alta resolución.

Utilizamos el filtrado de calidad para abordar varios desafíos comunes en las colecciones de documentos del mundo real. Si bien la mala calidad de la imagen en los documentos escaneados a menudo refleja casos de uso realistas, dificultó el control de la calidad de los datos sintéticos. Implementamos el filtrado de coherencia para eliminar duplicados (que son comunes en las grandes colecciones de documentos) y utilizamos LLM para filtrar consultas de baja calidad que no proporcionarían señales de evaluación útiles, como preguntas demasiado genéricas como "¿Qué puedes ver en el gráfico?". Para la generación de datos sintéticos, encontramos limitaciones en la diversidad de consultas a pesar de utilizar diversas estrategias de prompting, y necesitamos realizar una curación manual para garantizar una cobertura de evaluación suficiente en diferentes escenarios de recuperación.

tagConclusión

La evaluación de la recuperación de documentos visuales se encuentra ahora en una situación en la que los puntos de referencia tradicionales basados en texto ya no capturan la complejidad de cómo los humanos realmente buscan y consumen información. JinaVDR supera esta barrera al proporcionar una evaluación integral en una gama de tareas e idiomas que supera con creces los puntos de referencia anteriores.

En el futuro, la industria necesita puntos de referencia que reflejen los desafíos de recuperación genuinos en lugar de las limitaciones artificiales. A medida que las organizaciones confían más en la recuperación de documentos visuales para tareas que van desde la investigación legal hasta el diagnóstico médico, los marcos de evaluación deben evolucionar más allá de los conjuntos de datos académicos estrechos hacia los documentos desordenados, multilingües y visualmente complejos que encontramos en el mundo real. JinaVDR es solo el primer paso en la construcción de sistemas de recuperación que realmente comprendan cómo la información visual y textual trabajan juntas en la práctica.

Categorías:
Actualización de software
rss_feed

Leer más
marzo 18, 2024 • 7 minutos de lectura
Obtén Más con PromptPerfect: Mejores Opciones de Suscripción y Optimizador Interactivo de Última Generación
Alex C-G
Andrei Ungureanu
Logo with gradient blue-purple background, wave pattern, "v1.0" text, and abstract multicolored shapes at the forefront.
mayo 07, 2024 • 12 minutos de lectura
Cuando la IA Crea IA: Datos Sintéticos, Destilación de Modelos y Colapso de Modelos
Scott Martens
Abstract depiction of a brain in purple and pink hues with a fluid, futuristic design against a blue and purple background.
abril 29, 2024 • 9 minutos de lectura
Crea tu podcast personalizado con Jina Reader y PromptPerfect
Alex C-G
Neon-lit 3D microphone on black background with a white 'P' and arrow pointing right, amidst a green and blue glow.
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.