Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP terminalCLIarticlellms.txtsmart_toyАгентыdata_objectСхемаmenu_bookДокументы



Авторизоваться
login
Как мы создали JinaVDR
Существующие бенчмарки
Оценка 向量模型 на JinaVDR
Интеграция MTEB
Ограничения
Заключение
Обновление программного обеспечения
июль 25, 2025

JinaVDR: Новый бенчмарк для визуального поиска документов с 95 задачами на 20 языках

JinaVDR — это новый бенчмарк, охватывающий 95 задач на 20 языках для визуального поиска документов, который скоро появится на MTEB.
Maximilian Werk, Alex C-G • 8 минуты чтения
GitHub - jina-ai/jina-vdr: Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval
Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval - jina-ai/jina-vdr
GitHubjina-ai
JinaVDR (Visual Document Retrieval) - a jinaai Collection
max. ~1000 images and OCR text included
a jinaai Collection

Мы выпускаем JinaVDR (Visual Document Retrieval — поиск визуальных документов), новый бенчмарк для оценки того, насколько хорошо модели извлекают визуально сложные документы. JinaVDR охватывает многоязычные документы со сложной структурой, объединяющие графики, диаграммы, таблицы, текст и изображения, а также отсканированные копии и скриншоты. Бенчмарк сопоставляет эти разнообразные визуальные документы с целевыми текстовыми запросами, обеспечивая всестороннюю оценку производительности поиска в условиях сложности реальных документов и более широкого охвата предметных областей.

Бенчмарк Основная задача Языки Количество задач
JinaVDR Визуально насыщенные документы 20 языков 95
MIEB В основном естественные изображения 38 языков 130
ViDoRe v1 Визуально насыщенные документы Английский 5
ViDoRe v2 Визуально насыщенные документы Английский, французский, испанский, немецкий 4
Статистика JinaVDR, показывающая языки запросов/документов, домены и форматы документов

JinaVDR охватывает различные языки, предметные области и форматы документов, чтобы отразить реальные сценарии поиска. Хотя английский язык остается преобладающим как в запросах, так и в документах, бенчмарк включает более дюжины дополнительных языков, обеспечивая значительно более широкий многоязычный охват. Домены охватывают исторические документы, документацию по программному обеспечению, медицинские записи, юридические тексты и научные статьи, отражая различные варианты профессионального использования. Форматы документов варьируются от веб-страниц и PDF-файлов до отсканированных материалов, слайдов презентаций и отдельных изображений. Многие наборы данных намеренно смешивают языки и форматы, создавая реалистичные условия, которые заставляют модели справляться со сложностью, с которой они сталкиваются в практических приложениях.

tagКак мы создали JinaVDR

Бенчмарк JinaVDR предоставляет структуру оценки, охватывающую 95 задач на 20 языках, включая разнообразные по предметной области и насыщенные макетами документы, такие как диаграммы, карты, традиционные отсканированные документы, файлы Markdown и сложные таблицы. Он оценивает модели как посредством визуальных ответов на вопросы (например, “How many civil lawsuits were dismissed at the Valladolid audience in 1855?” — «Сколько гражданских исков было отклонено в суде Вальядолида в 1855 году?»), так и посредством запросов по ключевым словам (например, “growth of the LED market across different regions” — «рост рынка светодиодов в различных регионах»), что дает более четкую оценку возможностей поиска по различным типам документов, встречающихся в реальном мире.

Мы использовали четыре метода для создания JinaVDR с упором на разнообразие данных и подлинность задач:

Во-первых, мы перепрофилировали существующие бенчмарки, преобразовав наборы данных OCR в задачи поиска с использованием основанных на правилах шаблонов запросов (таких как преобразование данных MPMQA) и переформатировав наборы данных вопросов и ответов в сценарии поиска:

Пример документа MPMQA и запроса из бенчмарка JinaVDR

Во-вторых, мы вручную аннотировали существующие наборы данных PDF, включая StanfordSlides, TextbookQA и ShanghaiMasterPlan, чтобы создать высококачественные пары для поиска:

Пример документа StanfordSlides и запроса из бенчмарка JinaVDR

Наш третий подход включал синтетическую генерацию запросов и/или документов, где мы использовали существующие коллекции документов из таких источников, как Europeana, для создания контекстуально релевантных запросов с помощью Qwen2-VL-7B-Instruct, а также текстовых описаний EasyOCR:

Пример документа Europeana и запроса из бенчмарка JinaVDR, включая английский перевод запроса для справки

Мы также преобразовывали табличные наборы данных в визуальные таблицы и генерировали соответствующие запросы с помощью шаблонов, полученных из исходных текстовых данных, как показано в нашей задаче AirBnBRetrieval.

Наконец, мы перепрофилировали существующие наборы данных, полученные путем краулинга, с парами «статья-диаграмма», где мы используем текстовые фрагменты из статей в качестве запросов, а соответствующие диаграммы — в качестве целевых документов, как показано в нашем наборе данных OWIDRetrieval:

Пример документа OWIDRetrieval и запроса из бенчмарка JinaVDR

Этот многогранный подход обеспечивает нам всесторонний охват типов документов, языков и сценариев поиска.

tagСуществующие бенчмарки

Разработка по-настоящему мультимодальных моделей (которые могут обрабатывать визуально сложные документы) требует бенчмарков, выходящих за рамки традиционных методов оценки, основанных только на тексте. Фреймворки, такие как MTEB (Massive Text Embedding Benchmark — Масштабный бенчмарк для векторизации текста), могут хорошо работать для оценки поиска текста в различных доменах и на разных языках, но они не предназначены для поиска в документах, где точный поиск зависит от визуального макета, диаграмм, таблиц и форматирования. Именно здесь вступают в игру бенчмарки поиска визуальных документов (такие как серия ViDoRe) и бенчмарки поиска изображений (такие как MIEB, Massive Image Embedding Benchmark — Масштабный бенчмарк для векторизации изображений).

В статье ColPali представлен ViDoRe v1, который объединяет пять англоязычных наборов данных, как академических, так и синтетических. Бенчмарк фокусируется на одностраничных документах, которые хорошо работают с оптическим распознаванием символов (OCR), охватывает узкие области, такие как научные статьи и здравоохранение, и использует извлекающие запросы, в которых поисковые термины часто встречаются непосредственно в целевых документах.

Примеры из набора данных бенчмарка ViDoRe v1

После того как такие модели, как ColPali, достигли оценки 90% nDCG@5 в ViDoRe v1, потребовался новый бенчмарк. ViDoRe v2 улучшил v1, поддерживая более длинные и кросс-документные запросы, слепой контекстный поиск и больше языков (французский, немецкий и испанский в дополнение к английскому). Оба бенчмарка по-прежнему имеют ограниченное языковое разнообразие и узкий охват предметных областей, что оставляет пробелы для оценки новых поисковых систем.

Примеры из набора данных ViDoRe v2

MIEB использует другой подход, фокусируясь на визуальных 向量模型 по 130 задачам, включая и другие задачи, помимо простого поиска. Однако, в основном он оценивает изображения без большого количества текстового контента, а не визуально насыщенные документы. Хотя этот бенчмарк отлично подходит для тестирования возможностей визуального понимания, он не очень хорошо работает, когда вам нужно извлекать документы на основе визуальной структуры и текстового содержания.

Примеры из бенчмарка MIEB

Наша цель с бенчмарком JinaVDR (Visual Document Retrieval) - расширить работу предыдущих бенчмарков, включив в него визуально богатые многоязычные документы со сложной структурой, такие как графики, диаграммы и таблицы (смешанные с текстом и изображениями), а также добавить реальные запросы и вопросы.

tagОценка 向量模型 на JinaVDR

💡
Вы можете запустить бенчмарк самостоятельно, используя код в нашем репозитории GitHub.

Наши результаты показывают, что многие современные модели 向量模型 испытывают трудности с широким спектром задач визуальных документов JinaVDR, в то время как базовые показатели на основе OCR и более старые модели показывают еще более слабые результаты, особенно на неанглийских наборах данных и наборах данных структурированных документов. Мы включили BM25 с OCR для всех наборов данных, где простое извлечение текста делало такой поиск возможным.

Исключением из этого является jina-embeddings-v4. Наши результаты показывают, что его мультимодальный подход к 向量模型 обрабатывает сложный и многоязычный поиск документов лучше, чем модели предыдущего поколения или традиционные конвейеры на основе OCR. Возможность использования нескольких векторов у модели обеспечивает наилучшую производительность, поскольку позволяет избежать ограничений сжатия, свойственных подходам с одним вектором — в то время как один вектор должен вмещать содержание целой страницы в одно представление (что затрудняет захват конкретных деталей), подход с несколькими векторами сохраняет детализированную информацию, необходимую для точного поиска похожих документов.

Рисунок 9: Производительность моделей в бенчмарке JinaVDR, усредненная по всем задачам
Среднее значение medical-prescriptions DonutVQA TableVQA europeana-de-news europeana-es-news europeana-it-scans europeana-nl-legal hindi-gov-vqa jdocqa_jp wikimedia-commons-documents (ar) github-readme-retrieval-ml-filtered (ru)
BM25 + OCR 26.67% 38.18% 19.39% 35.64% 11.26% 51.99% 39.11% 34.97% 1.83% 1.64% 19.60% 39.78%
jina-embeddings-v3 + OCR 27.49% 37.25% 2.60% 34.24% 12.05% 44.03% 38.69% 29.07% 7.52% 7.79% 38.06% 51.07%
jina-clip-v2 17.79% 15.66% 1.63% 21.06% 11.19% 13.14% 16.23% 9.79% 5.02% 19.91% 45.29% 36.80%
colpali-v1.2 46.44% 83.91% 32.53% 54.66% 34.64% 44.74% 54.32% 30.89% 13.04% 39.45% 41.96% 80.67%
colqwen2-v0.1 58.26% 77.72% 46.34% 57.52% 53.42% 74.28% 71.23% 46.13% 20.53% 74.38% 36.94% 0.82388
MrLight/dse-qwen2-2b-mrl-v1 47.95% 38.22% 25.31% 57.39% 44.75% 60.58% 53.92% 29.50% 9.80% 66.73% 62.47% 78.77%
jina-embeddings-v4 (single-vector) 61.39% 81.17% 78.48% 58.90% 49.05% 60.10% 57.88% 37.14% 15.40% 75.57% 72.07% 89.55%
jina-embeddings-v4 (multivector) 70.89% 97.95% 73.55% 60.91% 65.65% 80.58% 73.14% 54.15% 21.94% 82.34% 81.19% 88.39%

tagИнтеграция MTEB

dataset: Add JinaVDR by maximilianwerk · Pull Request #2942 · embeddings-benchmark/mteb
Hey, we would like to contribute the JinaVDR benchmark to MTEB. Our aim with the JinaVDR (Visual Document Retrieval) benchmark is to expand upon the work of these prior benchmarks by incorporating…
GitHubembeddings-benchmark

Поскольку MTEB стал фактическим стандартом для сравнительного анализа поиска, мы интегрируем JinaVDR непосредственно в фреймворк MTEB, чтобы максимизировать его использование и упростить работу. Это упрощает для исследователей запуск моделей визуального поиска в нашем бенчмарке, используя привычную инфраструктуру оценки. Однако перенос наших данных в формат BEIR потребовал некоторых компромиссов, таких как исключение результатов OCR из версии MTEB. Это означает, что традиционные текстовые методы, такие как BM25, не могут быть запущены непосредственно как часть MTEB, что усиливает акцент на визуальном понимании документов, а не на возврате к текстовым методам поиска.

tagОграничения

Чтобы создать всесторонний бенчмарк из широкого спектра источников, нам пришлось выполнить тщательную предварительную обработку, чтобы обеспечить как практическую пригодность, так и качество оценки: Мы применили нормализацию размера, уменьшив каждый набор данных до максимум 1000 примеров (вместо тысяч или десятков тысяч), что сделало бенчмарк действительно запускаемым, сохраняя при этом хорошее покрытие задач. Это ограничение было особенно важно, учитывая высокий уровень вычислительных ресурсов, необходимых для обработки визуальных документов с высоким разрешением.

Мы использовали фильтрацию качества для решения нескольких задач, распространенных в реальных коллекциях документов. Хотя плохое качество изображений в отсканированных документах часто отражает реалистичные сценарии использования, это затрудняло контроль качества синтетических данных. Мы внедрили фильтрацию согласованности для удаления дубликатов (которые часто встречаются в больших коллекциях документов) и использовали LLM для фильтрации некачественных запросов, которые не предоставили бы полезных сигналов для оценки, таких как чрезмерно общие вопросы, такие как "What can you see in the chart?". При генерации синтетических данных мы столкнулись с ограничениями в разнообразии запросов, несмотря на использование различных стратегий 提示词, и нам потребовалась ручная проверка, чтобы обеспечить достаточное покрытие оценки в различных сценариях поиска.

tagЗаключение

В настоящее время оценка визуального поиска документов находится в ситуации, когда традиционные текстовые бенчмарки больше не отражают сложность того, как люди на самом деле ищут и потребляют информацию. JinaVDR преодолевает этот барьер, обеспечивая всестороннюю оценку по ряду задач и языков, что намного превосходит предыдущие бенчмарки.

Двигаясь вперед, отрасли нужны бенчмарки, которые отражают реальные задачи поиска, а не искусственные ограничения. Поскольку организации все больше полагаются на визуальный поиск документов для выполнения задач, от юридических исследований до медицинской диагностики, фреймворки оценки должны развиваться, выходя за рамки узких академических наборов данных и переходя к сложным, многоязычным и визуально сложным документам, которые мы находим в реальном мире. JinaVDR — это всего лишь первый шаг в создании систем поиска, которые действительно понимают, как визуальная и текстовая информация работают вместе на практике.

Категории:
Обновление программного обеспечения
rss_feed

Читать далее
март 18, 2024 • 7 минуты чтения
PromptPerfect становится лучше: улучшенные варианты подписки и передовой интерактивный оптимизатор
Alex C-G
Andrei Ungureanu
Logo with gradient blue-purple background, wave pattern, "v1.0" text, and abstract multicolored shapes at the forefront.
июнь 30, 2025 • 8 минуты чтения
jina-embeddings-v4 的量化感知训练
Andrei Ungureanu
Scott Martens
Bo Wang
Retro-style digital screen displaying four pixelated images: a cat, a woman, an abstract figure, and a man's portrait, with l
июнь 25, 2025 • 12 минуты чтения
Jina Embeddings v4: Универсальные векторные модели (Embeddings) для мультимодального многоязыкового поиска
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.