Мы выпускаем JinaVDR (Visual Document Retrieval — поиск визуальных документов), новый бенчмарк для оценки того, насколько хорошо модели извлекают визуально сложные документы. JinaVDR охватывает многоязычные документы со сложной структурой, объединяющие графики, диаграммы, таблицы, текст и изображения, а также отсканированные копии и скриншоты. Бенчмарк сопоставляет эти разнообразные визуальные документы с целевыми текстовыми запросами, обеспечивая всестороннюю оценку производительности поиска в условиях сложности реальных документов и более широкого охвата предметных областей.
| Бенчмарк | Основная задача | Языки | Количество задач |
|---|---|---|---|
| JinaVDR | Визуально насыщенные документы | 20 языков | 95 |
| MIEB | В основном естественные изображения | 38 языков | 130 |
| ViDoRe v1 | Визуально насыщенные документы | Английский | 5 |
| ViDoRe v2 | Визуально насыщенные документы | Английский, французский, испанский, немецкий | 4 |

JinaVDR охватывает различные языки, предметные области и форматы документов, чтобы отразить реальные сценарии поиска. Хотя английский язык остается преобладающим как в запросах, так и в документах, бенчмарк включает более дюжины дополнительных языков, обеспечивая значительно более широкий многоязычный охват. Домены охватывают исторические документы, документацию по программному обеспечению, медицинские записи, юридические тексты и научные статьи, отражая различные варианты профессионального использования. Форматы документов варьируются от веб-страниц и PDF-файлов до отсканированных материалов, слайдов презентаций и отдельных изображений. Многие наборы данных намеренно смешивают языки и форматы, создавая реалистичные условия, которые заставляют модели справляться со сложностью, с которой они сталкиваются в практических приложениях.
tagКак мы создали JinaVDR
Бенчмарк JinaVDR предоставляет структуру оценки, охватывающую 95 задач на 20 языках, включая разнообразные по предметной области и насыщенные макетами документы, такие как диаграммы, карты, традиционные отсканированные документы, файлы Markdown и сложные таблицы. Он оценивает модели как посредством визуальных ответов на вопросы (например, “How many civil lawsuits were dismissed at the Valladolid audience in 1855?” — «Сколько гражданских исков было отклонено в суде Вальядолида в 1855 году?»), так и посредством запросов по ключевым словам (например, “growth of the LED market across different regions” — «рост рынка светодиодов в различных регионах»), что дает более четкую оценку возможностей поиска по различным типам документов, встречающихся в реальном мире.
Мы использовали четыре метода для создания JinaVDR с упором на разнообразие данных и подлинность задач:
Во-первых, мы перепрофилировали существующие бенчмарки, преобразовав наборы данных OCR в задачи поиска с использованием основанных на правилах шаблонов запросов (таких как преобразование данных MPMQA) и переформатировав наборы данных вопросов и ответов в сценарии поиска:

Во-вторых, мы вручную аннотировали существующие наборы данных PDF, включая StanfordSlides, TextbookQA и ShanghaiMasterPlan, чтобы создать высококачественные пары для поиска:

Наш третий подход включал синтетическую генерацию запросов и/или документов, где мы использовали существующие коллекции документов из таких источников, как Europeana, для создания контекстуально релевантных запросов с помощью Qwen2-VL-7B-Instruct, а также текстовых описаний EasyOCR:

Мы также преобразовывали табличные наборы данных в визуальные таблицы и генерировали соответствующие запросы с помощью шаблонов, полученных из исходных текстовых данных, как показано в нашей задаче AirBnBRetrieval.
Наконец, мы перепрофилировали существующие наборы данных, полученные путем краулинга, с парами «статья-диаграмма», где мы используем текстовые фрагменты из статей в качестве запросов, а соответствующие диаграммы — в качестве целевых документов, как показано в нашем наборе данных OWIDRetrieval:

Этот многогранный подход обеспечивает нам всесторонний охват типов документов, языков и сценариев поиска.
tagСуществующие бенчмарки
Разработка по-настоящему мультимодальных моделей (которые могут обрабатывать визуально сложные документы) требует бенчмарков, выходящих за рамки традиционных методов оценки, основанных только на тексте. Фреймворки, такие как MTEB (Massive Text Embedding Benchmark — Масштабный бенчмарк для векторизации текста), могут хорошо работать для оценки поиска текста в различных доменах и на разных языках, но они не предназначены для поиска в документах, где точный поиск зависит от визуального макета, диаграмм, таблиц и форматирования. Именно здесь вступают в игру бенчмарки поиска визуальных документов (такие как серия ViDoRe) и бенчмарки поиска изображений (такие как MIEB, Massive Image Embedding Benchmark — Масштабный бенчмарк для векторизации изображений).
В статье ColPali представлен ViDoRe v1, который объединяет пять англоязычных наборов данных, как академических, так и синтетических. Бенчмарк фокусируется на одностраничных документах, которые хорошо работают с оптическим распознаванием символов (OCR), охватывает узкие области, такие как научные статьи и здравоохранение, и использует извлекающие запросы, в которых поисковые термины часто встречаются непосредственно в целевых документах.

После того как такие модели, как ColPali, достигли оценки 90% nDCG@5 в ViDoRe v1, потребовался новый бенчмарк. ViDoRe v2 улучшил v1, поддерживая более длинные и кросс-документные запросы, слепой контекстный поиск и больше языков (французский, немецкий и испанский в дополнение к английскому). Оба бенчмарка по-прежнему имеют ограниченное языковое разнообразие и узкий охват предметных областей, что оставляет пробелы для оценки новых поисковых систем.

MIEB использует другой подход, фокусируясь на визуальных 向量模型 по 130 задачам, включая и другие задачи, помимо простого поиска. Однако, в основном он оценивает изображения без большого количества текстового контента, а не визуально насыщенные документы. Хотя этот бенчмарк отлично подходит для тестирования возможностей визуального понимания, он не очень хорошо работает, когда вам нужно извлекать документы на основе визуальной структуры и текстового содержания.

Наша цель с бенчмарком JinaVDR (Visual Document Retrieval) - расширить работу предыдущих бенчмарков, включив в него визуально богатые многоязычные документы со сложной структурой, такие как графики, диаграммы и таблицы (смешанные с текстом и изображениями), а также добавить реальные запросы и вопросы.
tagОценка 向量模型 на JinaVDR
Наши результаты показывают, что многие современные модели 向量模型 испытывают трудности с широким спектром задач визуальных документов JinaVDR, в то время как базовые показатели на основе OCR и более старые модели показывают еще более слабые результаты, особенно на неанглийских наборах данных и наборах данных структурированных документов. Мы включили BM25 с OCR для всех наборов данных, где простое извлечение текста делало такой поиск возможным.
Исключением из этого является jina-embeddings-v4. Наши результаты показывают, что его мультимодальный подход к 向量模型 обрабатывает сложный и многоязычный поиск документов лучше, чем модели предыдущего поколения или традиционные конвейеры на основе OCR. Возможность использования нескольких векторов у модели обеспечивает наилучшую производительность, поскольку позволяет избежать ограничений сжатия, свойственных подходам с одним вектором — в то время как один вектор должен вмещать содержание целой страницы в одно представление (что затрудняет захват конкретных деталей), подход с несколькими векторами сохраняет детализированную информацию, необходимую для точного поиска похожих документов.

| Среднее значение | medical-prescriptions | DonutVQA | TableVQA | europeana-de-news | europeana-es-news | europeana-it-scans | europeana-nl-legal | hindi-gov-vqa | jdocqa_jp | wikimedia-commons-documents (ar) | github-readme-retrieval-ml-filtered (ru) | |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| BM25 + OCR | 26.67% | 38.18% | 19.39% | 35.64% | 11.26% | 51.99% | 39.11% | 34.97% | 1.83% | 1.64% | 19.60% | 39.78% |
jina-embeddings-v3 + OCR |
27.49% | 37.25% | 2.60% | 34.24% | 12.05% | 44.03% | 38.69% | 29.07% | 7.52% | 7.79% | 38.06% | 51.07% |
| jina-clip-v2 | 17.79% | 15.66% | 1.63% | 21.06% | 11.19% | 13.14% | 16.23% | 9.79% | 5.02% | 19.91% | 45.29% | 36.80% |
colpali-v1.2 |
46.44% | 83.91% | 32.53% | 54.66% | 34.64% | 44.74% | 54.32% | 30.89% | 13.04% | 39.45% | 41.96% | 80.67% |
colqwen2-v0.1 |
58.26% | 77.72% | 46.34% | 57.52% | 53.42% | 74.28% | 71.23% | 46.13% | 20.53% | 74.38% | 36.94% | 0.82388 |
MrLight/dse-qwen2-2b-mrl-v1 |
47.95% | 38.22% | 25.31% | 57.39% | 44.75% | 60.58% | 53.92% | 29.50% | 9.80% | 66.73% | 62.47% | 78.77% |
jina-embeddings-v4 (single-vector) |
61.39% | 81.17% | 78.48% | 58.90% | 49.05% | 60.10% | 57.88% | 37.14% | 15.40% | 75.57% | 72.07% | 89.55% |
jina-embeddings-v4 (multivector) |
70.89% | 97.95% | 73.55% | 60.91% | 65.65% | 80.58% | 73.14% | 54.15% | 21.94% | 82.34% | 81.19% | 88.39% |
tagИнтеграция MTEB
Поскольку MTEB стал фактическим стандартом для сравнительного анализа поиска, мы интегрируем JinaVDR непосредственно в фреймворк MTEB, чтобы максимизировать его использование и упростить работу. Это упрощает для исследователей запуск моделей визуального поиска в нашем бенчмарке, используя привычную инфраструктуру оценки. Однако перенос наших данных в формат BEIR потребовал некоторых компромиссов, таких как исключение результатов OCR из версии MTEB. Это означает, что традиционные текстовые методы, такие как BM25, не могут быть запущены непосредственно как часть MTEB, что усиливает акцент на визуальном понимании документов, а не на возврате к текстовым методам поиска.
tagОграничения
Чтобы создать всесторонний бенчмарк из широкого спектра источников, нам пришлось выполнить тщательную предварительную обработку, чтобы обеспечить как практическую пригодность, так и качество оценки: Мы применили нормализацию размера, уменьшив каждый набор данных до максимум 1000 примеров (вместо тысяч или десятков тысяч), что сделало бенчмарк действительно запускаемым, сохраняя при этом хорошее покрытие задач. Это ограничение было особенно важно, учитывая высокий уровень вычислительных ресурсов, необходимых для обработки визуальных документов с высоким разрешением.
Мы использовали фильтрацию качества для решения нескольких задач, распространенных в реальных коллекциях документов. Хотя плохое качество изображений в отсканированных документах часто отражает реалистичные сценарии использования, это затрудняло контроль качества синтетических данных. Мы внедрили фильтрацию согласованности для удаления дубликатов (которые часто встречаются в больших коллекциях документов) и использовали LLM для фильтрации некачественных запросов, которые не предоставили бы полезных сигналов для оценки, таких как чрезмерно общие вопросы, такие как "What can you see in the chart?". При генерации синтетических данных мы столкнулись с ограничениями в разнообразии запросов, несмотря на использование различных стратегий 提示词, и нам потребовалась ручная проверка, чтобы обеспечить достаточное покрытие оценки в различных сценариях поиска.
tagЗаключение
В настоящее время оценка визуального поиска документов находится в ситуации, когда традиционные текстовые бенчмарки больше не отражают сложность того, как люди на самом деле ищут и потребляют информацию. JinaVDR преодолевает этот барьер, обеспечивая всестороннюю оценку по ряду задач и языков, что намного превосходит предыдущие бенчмарки.
Двигаясь вперед, отрасли нужны бенчмарки, которые отражают реальные задачи поиска, а не искусственные ограничения. Поскольку организации все больше полагаются на визуальный поиск документов для выполнения задач, от юридических исследований до медицинской диагностики, фреймворки оценки должны развиваться, выходя за рамки узких академических наборов данных и переходя к сложным, многоязычным и визуально сложным документам, которые мы находим в реальном мире. JinaVDR — это всего лишь первый шаг в создании систем поиска, которые действительно понимают, как визуальная и текстовая информация работают вместе на практике.









