Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP terminalコマンドラインarticlellms.txtsmart_toyエージェントdata_objectスキーマmenu_bookドキュメント



ログイン
login
JinaVDRの構築方法
既存のベンチマーク
JinaVDRでの埋め込み(Embeddings)の評価
MTEBの統合
制限事項
結論
ソフトウェアの更新
7月 25, 2025

JinaVDR:20言語で95のタスクを網羅した新しいVisual Document Retrievalベンチマーク

JinaVDRは、視覚的なドキュメント検索のための新しいベンチマークであり、20言語にわたる95のタスクを網羅しています。近日中にMTEBで公開予定です。
Maximilian Werk, Alex C-G • 8 読む時間
GitHub - jina-ai/jina-vdr: Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval
Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval - jina-ai/jina-vdr
GitHubjina-ai
JinaVDR (Visual Document Retrieval) - a jinaai Collection
max. ~1000 images and OCR text included
a jinaai Collection

この度、モデルが視覚的に複雑なドキュメントをどれだけうまく検索できるかを評価するための新しいベンチマークである JinaVDR (Visual Document Retrieval、視覚的ドキュメント検索)をリリースします。JinaVDRには、グラフ、チャート、表、テキスト、画像、スキャンされたコピー、スクリーンショットなど、複雑なレイアウトの多言語ドキュメントが含まれています。このベンチマークでは、これらの多様な視覚的ドキュメントと、対象を絞ったテキストクエリを組み合わせることで、現実世界のドキュメントの複雑さと、より広範なドメイン範囲にわたる検索パフォーマンスを包括的に評価できます。

Benchmark Task focus Languages Number of tasks
JinaVDR Visually rich documents 20 languages 95
MIEB Mostly natural images 38 languages 130
ViDoRe v1 Visually rich documents English 5
ViDoRe v2 Visually rich documents English, French, Spanish, German 4
JinaVDRの統計。クエリ/ドキュメントの言語、ドメイン、ドキュメント形式を示す

JinaVDRは、現実世界の検索シナリオを反映するために、多様な言語、ドメイン、およびドキュメント形式にまたがっています。クエリとドキュメントの両方で英語が依然として主流ですが、このベンチマークには10以上の追加言語が組み込まれており、大幅に広範な多言語対応を提供します。ドメインは、歴史的文書、ソフトウェアドキュメント、医療記録、法的テキスト、および科学論文を網羅し、多様な専門的な使用事例を捉えています。ドキュメント形式は、ウェブページやPDFから、スキャンされた資料、プレゼンテーションスライド、およびスタンドアロン画像にまで及びます。多くのデータセットは、意図的に言語と形式を混在させており、モデルが実際のアプリケーションで遭遇する複雑さを処理するように促す、現実的な条件を作り出しています。

tagJinaVDRの構築方法

JinaVDRベンチマークは、チャート、地図、従来のスキャンされたドキュメント、Markdownファイル、複雑な表など、ドメインが多様でレイアウトが豊富なドキュメントを含む、20の言語にわたる95のタスクにまたがる評価フレームワークを提供します。視覚的な質問応答(たとえば、“How many civil lawsuits were dismissed at the Valladolid audience in 1855?”)と、キーワードクエリ(たとえば、“growth of the LED market across different regions”)の両方を通じてモデルを評価し、現実世界で見られるさまざまな種類のドキュメントでの検索機能をより明確に評価します。

データの多様性とタスクの信頼性に焦点を当ててJinaVDRを構築するために、4つの手法を使用しました。

まず、ルールベースのクエリテンプレートを使用してOCRデータセットを検索タスクに変換する(MPMQAデータなどの変換)ことや、質問応答データセットを検索シナリオに再フォーマットするなどして、既存のベンチマークを転用しました。

JinaVDRベンチマークからのMPMQAドキュメントとクエリのサンプル

次に、StanfordSlides、TextbookQA、およびShanghaiMasterPlanを含む既存のPDFデータセットに手動でアノテーションを付け、高品質の検索ペアを作成しました。

JinaVDRベンチマークからのStanfordSlidesドキュメントとクエリのサンプル

3番目のアプローチとして、合成クエリおよび/またはドキュメントの生成を行いました。ここでは、Europeanaなどのソースからの既存のドキュメントコレクションを使用して、Qwen2-VL-7B-Instructで文脈的に関連するクエリを作成し、さらにEasyOCRテキスト記述を追加しました。

JinaVDRベンチマークからのEuropeanaドキュメントとクエリのサンプル(参考として英語クエリの翻訳を含む)

また、表形式のデータセットを視覚的な表にレンダリングし、AirBnBRetrievalタスクで示されているように、元のテキストデータから派生したテンプレートを通じて対応するクエリを生成しました。

最後に、既存のクロールされたデータセットを転用しました。ここでは、記事からのテキストスニペットをクエリとして使用し、対応するチャートをターゲットドキュメントとして使用します。これは、OWIDRetrievalデータセットに示されています。

JinaVDRベンチマークからのOWIDRetrievalドキュメントとクエリのサンプル

この多面的なアプローチにより、ドキュメントの種類、言語、および検索シナリオ全体を包括的にカバーできます。

tag既存のベンチマーク

真にマルチモーダルなモデル(視覚的に複雑なドキュメントを処理できるモデル)を開発するには、従来のテキストのみの評価方法を超えるベンチマークが必要です。MTEB(Massive Text Embedding Benchmark)のようなフレームワークは、さまざまなドメインや言語にわたるテキスト検索の評価には適していますが、正確な検索が視覚的なレイアウト、チャート、表、および書式設定に依存するドキュメントの検索には適していません。そこで、視覚的なドキュメント検索ベンチマーク(ViDoReシリーズなど)と、画像検索ベンチマーク(MIEB、Massive Image Embedding Benchmarkなど)が登場します。

ColPali論文では、学術的および合成的な5つの英語データセットを組み合わせたViDoRe v1が紹介されました。このベンチマークは、光学文字認識(OCR)に適した単一ページのドキュメントに焦点を当てており、科学論文やヘルスケアなどの狭いドメインをカバーし、検索用語がターゲットドキュメントに直接現れることが多い抽出クエリを使用しています。

ViDoRe v1ベンチマークデータセットからのサンプル

ColPaliなどのモデルがViDoRe v1で90% nDCG@5のスコアに達した後、新しいベンチマークが必要になりました。ViDoRe v2は、より長く、クロスドキュメントのクエリ、ブラインドコンテキストクエリ、およびより多くの言語(英語に加えてフランス語、ドイツ語、スペイン語)をサポートすることで、v1を改善しました。どちらのベンチマークも、言語の多様性が限られており、ドメインの範囲が狭いため、新しい検索システムを評価するためのギャップが残っています。

ViDoRe v2ベンチマークデータセットからのサンプル

MIEBは、検索だけでなく、他のタスクを含む130のタスクにわたる視覚的埋め込み(embeddings)に焦点を当てることで、異なるアプローチを取っています。ただし、視覚的に豊富なドキュメントというよりは、テキストコンテンツがあまりない画像を主に評価します。このベンチマークは、視覚的な理解能力をテストするのに優れていますが、視覚的なレイアウトとテキストコンテンツに基づいてドキュメントを検索する必要がある場合には、うまく機能しません。

MIEBベンチマークからのサンプル

JinaVDR(Visual Document Retrieval)ベンチマークにおける私たちの目的は、グラフ、チャート、テーブル(テキストや画像と混在)のような複雑なレイアウトを持つ、視覚的に豊かな多言語ドキュメントを組み込み、実際のクエリや質問を追加することで、これらの以前のベンチマークの取り組みを拡張することです。

tagJinaVDRでの埋め込み(Embeddings)の評価

💡
GitHubリポジトリにあるコードを使用して、ベンチマークを自分で実行できます。

私たちのベンチマーク結果は、多くの最新の埋め込みモデル(embedding models)がJinaVDRの幅広い視覚的ドキュメントタスクに苦戦していることを示しています。一方、OCRベースのベースラインおよび古いモデルは、特に英語以外の言語や構造化されたドキュメントデータセットで、さらに弱い結果を示しています。単純なテキスト抽出がそのような検索を可能にするすべてのデータセットに対して、OCRを使用したBM25を含めました。

この例外は、jina-embeddings-v4です。私たちの結果は、そのマルチモーダル埋め込み(embedding)アプローチが、以前の世代のモデルや従来のOCRベースのパイプラインよりも、複雑で多言語のドキュメント検索をよりうまく処理することを示唆しています。このモデルのマルチベクトル機能は、単一ベクトルアプローチの圧縮制限を回避するため、最高のパフォーマンスを提供します。単一ベクトルはページ全体のコンテンツを1つの表現に詰め込む必要があるため(特定詳細のキャプチャが困難になる)、マルチベクトルアプローチは、類似ドキュメントの正確な検索に必要な詳細な情報を保持します。

図9:JinaVDRベンチマークでのモデルパフォーマンス(すべてのタスクで平均)
平均 medical-prescriptions DonutVQA TableVQA europeana-de-news europeana-es-news europeana-it-scans europeana-nl-legal hindi-gov-vqa jdocqa_jp wikimedia-commons-documents (ar) github-readme-retrieval-ml-filtered (ru)
BM25 + OCR 26.67% 38.18% 19.39% 35.64% 11.26% 51.99% 39.11% 34.97% 1.83% 1.64% 19.60% 39.78%
jina-embeddings-v3 + OCR 27.49% 37.25% 2.60% 34.24% 12.05% 44.03% 38.69% 29.07% 7.52% 7.79% 38.06% 51.07%
jina-clip-v2 17.79% 15.66% 1.63% 21.06% 11.19% 13.14% 16.23% 9.79% 5.02% 19.91% 45.29% 36.80%
colpali-v1.2 46.44% 83.91% 32.53% 54.66% 34.64% 44.74% 54.32% 30.89% 13.04% 39.45% 41.96% 80.67%
colqwen2-v0.1 58.26% 77.72% 46.34% 57.52% 53.42% 74.28% 71.23% 46.13% 20.53% 74.38% 36.94% 0.82388
MrLight/dse-qwen2-2b-mrl-v1 47.95% 38.22% 25.31% 57.39% 44.75% 60.58% 53.92% 29.50% 9.80% 66.73% 62.47% 78.77%
jina-embeddings-v4 (single-vector) 61.39% 81.17% 78.48% 58.90% 49.05% 60.10% 57.88% 37.14% 15.40% 75.57% 72.07% 89.55%
jina-embeddings-v4 (multivector) 70.89% 97.95% 73.55% 60.91% 65.65% 80.58% 73.14% 54.15% 21.94% 82.34% 81.19% 88.39%

tagMTEBの統合

dataset: Add JinaVDR by maximilianwerk · Pull Request #2942 · embeddings-benchmark/mteb
Hey, we would like to contribute the JinaVDR benchmark to MTEB. Our aim with the JinaVDR (Visual Document Retrieval) benchmark is to expand upon the work of these prior benchmarks by incorporating…
GitHubembeddings-benchmark

MTEBが検索ベンチマークの事実上の標準になったため、採用と使いやすさを最大化するために、JinaVDRをMTEBフレームワークに直接統合しています。これにより、研究者は使い慣れた評価インフラストラクチャを使用して、私たちのベンチマークで視覚的検索モデルをより簡単に実行できます。ただし、データをBEIR形式に移行するには、MTEBバージョンにOCR結果を含めないなど、いくつかのトレードオフが必要でした。これは、BM25のような従来のテキストベースの手法がMTEBの一部として直接実行できないことを意味し、テキストベースの検索手法に頼るのではなく、視覚的ドキュメント理解に焦点を当てることを強化します。

tag制限事項

幅広いソースから包括的なベンチマークを構築するために、実用的な使いやすさと評価品質の両方を確保するために、慎重な前処理を行う必要がありました。各データセットを最大1,000個のサンプルにサブサンプリングすることにより、サイズ正規化を適用しました(数千または数万から削減)。これにより、タスク全体の良好なカバレッジを維持しながら、ベンチマークを実際に実行可能にしました。この制約は、高解像度の視覚的ドキュメントを処理するために必要な高度な計算量を考えると、特に重要でした。

現実世界のドキュメントコレクションで一般的な、いくつかの課題に対処するために、品質フィルタリングを使用しました。スキャンされたドキュメントの画質が悪いことは、現実的なユースケースを反映していることが多いですが、合成データの品質を管理することがより困難になりました。重複を削除するために一貫性フィルタリングを実装し(大規模なドキュメントコレクションでは一般的です)、"What can you see in the chart?"のような過度に一般的な質問など、有用な評価シグナルを提供しない低品質のクエリをフィルタリングするためにLLMを使用しました。合成データ生成では、さまざまなプロンプト戦略を使用してもクエリの多様性に限界があり、さまざまな検索シナリオ全体で十分な評価カバレッジを確保するために手動でキュレーションする必要がありました。

tag結論

視覚的ドキュメント検索の評価は現在、従来のテキストベースのベンチマークでは、人間が実際に情報を検索して消費する方法の複雑さを捉えられなくなっている状況にあります。JinaVDRは、以前のベンチマークをはるかに超える範囲のタスクと言語にわたる包括的な評価を提供することにより、この障壁を克服します。

今後、業界は人工的な制約ではなく、真の検索の課題を反映するベンチマークを必要としています。組織が法務調査から医療診断まで、さまざまなタスクで視覚的ドキュメント検索にますます依存するようになるにつれて、評価フレームワークは、狭い学術データセットから、私たちが現実世界で見つける雑多で多言語で視覚的に複雑なドキュメントへと進化する必要があります。JinaVDRは、視覚情報とテキスト情報が実際にどのように連携するかを真に理解する検索システムを構築するための最初のステップにすぎません。

カテゴリー:
ソフトウェアの更新
rss_feed

続きを読む
3月 18, 2024 • 7 読む時間
PromptPerfect の機能拡充:進化したサブスクリプションと最新のインタラクティブ オプティマイザー
Alex C-G
Andrei Ungureanu
Logo with gradient blue-purple background, wave pattern, "v1.0" text, and abstract multicolored shapes at the forefront.
5月 24, 2024 • 4 読む時間
RAG は再び終わりを迎えるのか?
Han Xiao
Cartoon of four characters in a cemetery with graves marked "RAG," mixing somber themes with humorous actions.
5月 22, 2024 • 10 読む時間
PromptPerfect で制限をバイパス:モデルが生成を制限している画像を作成する
Alex C-G
Colorful digital chain graphic with vibrant bricks against a black background, conveying energy and connectivity.
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。