Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP terminal命令列articlellms.txtsmart_toy智慧體data_objectSchemamenu_book文件



登入
login
How We Build JinaVDR
Existing Benchmarks
在 JinaVDR 上評估向量模型
MTEB 整合
限制
結論
軟體更新
七月 25, 2025

JinaVDR:全新視覺文件檢索基準,包含 20 種語言的 95 個任務

JinaVDR 是一個新的基準測試,涵蓋 20 種語言的 95 個視覺文件檢索任務,即將在 MTEB 上推出。
Maximilian Werk, Alex C-G • 8 分鐘閱讀
GitHub - jina-ai/jina-vdr: Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval
Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval - jina-ai/jina-vdr
GitHubjina-ai
JinaVDR (Visual Document Retrieval) - a jinaai Collection
max. ~1000 images and OCR text included
a jinaai Collection

我們正在發布 JinaVDR (Visual Document Retrieval,視覺化文件檢索),這是一個新的基準,用於評估模型檢索視覺上複雜文件的能力。JinaVDR 涵蓋了具有複雜佈局的多語言文件,結合了圖表、表格、文字、圖像以及掃描副本和螢幕截圖。該基準將這些多樣化的視覺文件與目標文字查詢配對,從而能夠全面評估跨真實世界文件複雜性和更廣泛領域覆蓋範圍的檢索效能。

Benchmark Task focus Languages Number of tasks
JinaVDR Visually rich documents 20 languages 95
MIEB Mostly natural images 38 languages 130
ViDoRe v1 Visually rich documents English 5
ViDoRe v2 Visually rich documents English, French, Spanish, German 4
JinaVDR 統計資料,顯示查詢/文件語言、領域和文件格式

JinaVDR 涵蓋多種語言、領域和文件格式,以反映真實世界的檢索情境。雖然英語在查詢和文件中仍然佔主導地位,但該基準納入了十幾種額外的語言,提供了顯著更廣泛的多語言覆蓋範圍。這些領域涵蓋了歷史文檔、軟體文檔、醫療記錄、法律文本和科學論文,涵蓋了各種專業用例。文件格式範圍從網頁和 PDF 到掃描材料、簡報投影片和獨立圖像。許多資料集有意混合語言和格式,創造了真實的條件,挑戰模型處理在實際應用中遇到的複雜性。

tagHow We Build JinaVDR

JinaVDR 基準提供了一個評估框架,涵蓋 20 種語言的 95 項任務,包括領域多樣化和佈局豐富的文件,例如圖表、地圖、傳統掃描文檔、Markdown 檔案和複雜表格。它透過視覺問題回答(例如,“How many civil lawsuits were dismissed at the Valladolid audience in 1855?”)和關鍵字查詢(例如,“growth of the LED market across different regions”)來評估模型,從而更清楚地評估在真實世界中發現的不同文件類型的檢索能力。

我們使用了四種技術來構建 JinaVDR,重點關注資料多樣性和任務真實性:

首先,我們透過使用基於規則的查詢範本將 OCR 資料集轉換為檢索任務(例如轉換 MPMQA 資料)並將問答資料集重新格式化為檢索情境,從而重新利用現有的基準:

來自 JinaVDR 基準的 MPMQA 文件和查詢範例

其次,我們手動註釋現有的 PDF 資料集,包括 StanfordSlides、TextbookQA 和 ShanghaiMasterPlan,以建立高品質的檢索配對:

來自 JinaVDR 基準的 StanfordSlides 文件和查詢範例

我們的第三種方法涉及合成查詢和/或文件生成,我們使用來自 Europeana 等來源的現有文件集合,透過 Qwen2-VL-7B-Instruct 建立與上下文相關的查詢,以及 EasyOCR 文字描述:

來自 JinaVDR 基準的 Europeana 文件和查詢範例,包括英文查詢翻譯以供參考

我們還將表格資料集呈現為視覺表格,並透過從原始文字資料衍生的範本生成相應的查詢,如我們的 AirBnBRetrieval 任務中所展示。

最後,我們重新利用現有的網路爬蟲資料集,其中包含文章圖表配對,我們使用文章中的文字片段作為查詢,並使用相應的圖表作為目標文件,如我們的 OWIDRetrieval 資料集所示:

來自 JinaVDR 基準的 OWIDRetrieval 文件和查詢範例

這種多面向的方法使我們能夠全面覆蓋文件類型、語言和檢索情境。

tagExisting Benchmarks

開發真正多模態的模型(可以處理視覺上複雜的文件)需要超越傳統的純文字評估方法的基準。像 MTEB (Massive Text Embedding Benchmark,大規模文字向量模型基準) 這樣的框架可能非常適合評估跨不同領域和語言的文字檢索,但它們不是為搜尋準確檢索取決於視覺佈局、圖表、表格和格式的文件而建構的。這就是視覺化文件檢索基準(如 ViDoRe 系列)和圖像檢索基準(如 MIEB,大規模圖像向量模型基準)的用武之地。

ColPali 論文介紹了 ViDoRe v1,它結合了五個英語資料集,包括學術資料集和合成資料集。該基準關注的是適用於光學字元識別 (OCR) 的單頁文件,涵蓋科學論文和醫療保健等狹窄領域,並使用提取式查詢,其中搜尋詞通常直接出現在目標文件中。

來自 ViDoRe v1 基準資料集的範例

在像 ColPali 這樣的模型在 ViDoRe v1 上達到 90% nDCG@5 的分數後,就需要一個新的基準。ViDoRe v2 透過支援更長和跨文件的查詢、盲上下文查詢以及更多語言(除了英語之外,還有法語、德語和西班牙語)來改進 v1。這兩個基準仍然具有有限的語言多樣性和狹窄的領域覆蓋範圍,為評估新的檢索系統留下了空白。

ViDoRe v2 基準資料集的樣本

MIEB 採取了一種不同的方法,專注於跨 130 項任務的視覺向量模型,包括檢索以外的其他任務。然而,它主要評估沒有太多文字內容的圖像,而不是視覺上豐富的文件。雖然該基準在測試視覺理解能力方面表現出色,但當您需要根據視覺佈局和文字內容檢索文件時,它的表現並不理想。

MIEB 基準測試的樣本

我們使用 JinaVDR (Visual Document Retrieval) 基準測試的目的是擴展這些先前基準測試的工作,方法是納入具有複雜佈局(如圖表和表格,並混合文字和圖像)的視覺上豐富的多語言文件,以及新增真實世界的查詢和問題。

tag在 JinaVDR 上評估向量模型

💡
您可以使用我們 GitHub repo 上的程式碼自行執行基準測試。

我們的基準測試結果顯示,許多最新的向量模型在 JinaVDR 的各種視覺文件任務中表現不佳,而基於 OCR 的基準和較舊的模型則顯示出更弱的結果,尤其是在非英語和結構化文件資料集上。我們在簡單文字擷取可行的所有資料集中都加入了帶有 OCR 的 BM25。

jina-embeddings-v4 是一個例外。我們的結果表明,與早期世代模型或傳統的基於 OCR 的管線相比,它的多模態向量模型方法更能處理複雜的多語言文件檢索。該模型的多向量能力提供了最佳效能,因為它可以避免單向量方法的壓縮限制 — 雖然單向量必須將整個頁面的內容塞入一個表示中(使其難以捕捉特定細節),但多向量方法可以保持精確檢索相似文件所需的細微資訊。

圖 9:JinaVDR 基準測試的模型效能,平均計算所有任務
Average medical-prescriptions DonutVQA TableVQA europeana-de-news europeana-es-news europeana-it-scans europeana-nl-legal hindi-gov-vqa jdocqa_jp wikimedia-commons-documents (ar) github-readme-retrieval-ml-filtered (ru)
BM25 + OCR 26.67% 38.18% 19.39% 35.64% 11.26% 51.99% 39.11% 34.97% 1.83% 1.64% 19.60% 39.78%
jina-embeddings-v3 + OCR 27.49% 37.25% 2.60% 34.24% 12.05% 44.03% 38.69% 29.07% 7.52% 7.79% 38.06% 51.07%
jina-clip-v2 17.79% 15.66% 1.63% 21.06% 11.19% 13.14% 16.23% 9.79% 5.02% 19.91% 45.29% 36.80%
colpali-v1.2 46.44% 83.91% 32.53% 54.66% 34.64% 44.74% 54.32% 30.89% 13.04% 39.45% 41.96% 80.67%
colqwen2-v0.1 58.26% 77.72% 46.34% 57.52% 53.42% 74.28% 71.23% 46.13% 20.53% 74.38% 36.94% 0.82388
MrLight/dse-qwen2-2b-mrl-v1 47.95% 38.22% 25.31% 57.39% 44.75% 60.58% 53.92% 29.50% 9.80% 66.73% 62.47% 78.77%
jina-embeddings-v4 (single-vector) 61.39% 81.17% 78.48% 58.90% 49.05% 60.10% 57.88% 37.14% 15.40% 75.57% 72.07% 89.55%
jina-embeddings-v4 (multivector) 70.89% 97.95% 73.55% 60.91% 65.65% 80.58% 73.14% 54.15% 21.94% 82.34% 81.19% 88.39%

tagMTEB 整合

dataset: Add JinaVDR by maximilianwerk · Pull Request #2942 · embeddings-benchmark/mteb
Hey, we would like to contribute the JinaVDR benchmark to MTEB. Our aim with the JinaVDR (Visual Document Retrieval) benchmark is to expand upon the work of these prior benchmarks by incorporating…
GitHubembeddings-benchmark

由於 MTEB 已成為檢索基準測試的事實標準,因此我們將 JinaVDR 直接整合到 MTEB 框架中,以最大限度地提高採用率和易用性。這使得研究人員可以使用熟悉的評估基礎架構,更輕鬆地在我們的基準測試上執行視覺檢索模型。但是,將我們的資料移轉到 BEIR 格式確實需要一些權衡,例如不在 MTEB 版本中包含 OCR 結果。這意味著傳統的基於文字的方法(如 BM25)無法直接作為 MTEB 的一部分執行,這強化了對視覺文件理解的關注,而不是退回到基於文字的檢索方法。

tag限制

為了從各種來源建立全面的基準測試,我們必須執行仔細的預處理,以確保實際可用性和評估品質:我們透過將每個資料集子取樣到最多 1,000 個範例(從數千個或數萬個減少),來應用大小正規化,使基準測試真正可執行,同時保持跨任務的良好覆蓋率。考慮到我們處理高解析度視覺文件所需的高計算量,這種約束尤其重要。

我們使用品質篩選來解決真實世界文件集合中常見的幾個挑戰。雖然掃描文件中較差的影像品質通常反映了真實的使用案例,但這使得更難控制合成資料的品質。我們實作了一致性篩選以移除重複項(這在大型文件集合中很常見),並使用大模型篩選掉無法提供有用評估訊號的低品質查詢,例如過於通用的問題,如 "What can you see in the chart?"。對於合成資料產生,儘管使用了各種提示詞策略,我們仍然遇到了查詢多樣性的限制,並且需要執行手動管理,以確保在不同的檢索情境中提供足夠的評估覆蓋率。

tag結論

視覺文件檢索評估現在面臨一種情況,即傳統的基於文字的基準測試不再能捕捉到人類實際搜尋和消費資訊的複雜性。JinaVDR 透過提供跨一系列任務和語言的全面評估,遠遠超過了先前的基準測試,從而克服了這一障礙。

展望未來,業界需要反映真正檢索挑戰而不是人為約束的基準測試。隨著組織越來越依賴視覺文件檢索來執行從法律研究到醫療診斷等任務,評估框架必須超越狹隘的學術資料集,轉向我們在現實世界中發現的混亂、多語言和視覺上複雜的文件。JinaVDR 只是建立真正了解視覺和文字資訊如何在實務中協同工作的檢索系統的第一步。

類別:
軟體更新
rss_feed

閱讀更多
三月 18, 2024 • 7 分鐘閱讀
PromptPerfect 升級優惠方案,全新互動式提示詞優化工具
Alex C-G
Andrei Ungureanu
Logo with gradient blue-purple background, wave pattern, "v1.0" text, and abstract multicolored shapes at the forefront.
十二月 17, 2024 • 12 分鐘閱讀
文字嵌入無法捕捉詞序以及如何解決這個問題
Bo Wang
Alex C-G
Three abstract figures in white, gray, and pink on matching cubes placed on a colorful checkered surface against a green back
十二月 17, 2024
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
ACL 2025
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。