Elastic
Jina AI
モデル
API
keyboard_arrow_down
Reader
任意の URL を Markdown に変換し、LLM のグラウンディングを向上させます。
Embeddings
マルチモーダルかつ多言語の埋め込み。
Reranker
検索エンジンのランキングを再調整して、検索関連性を最大化する。
Elastic Inference Service
Elasticsearch内でJinaモデルをネイティブに実行する。
MCP
terminal
コマンドライン
article
llms.txt
smart_toy
エージェント
data_object
スキーマ
menu_book
ドキュメント
ログイン
login
自明な解決策が失敗する場合
実際に起こること
シンプルな2段階パイプライン
結論
技術ブログ
5月 25, 2025

jina-reranker-m0 を使用したマルチモーダルドキュメントのフェアなスコアリング

テキスト類似度:0.7。画像類似度:0.5。どちらのドキュメントがより関連性が高いでしょうか?文字通り判断できません。それが、マルチモーダル検索を阻害している根本的な問題です。私たちは、統一された重排器 (Reranker) によってそれを解決します。
Nan Wang, Alex C-G • 8 読む時間

スポーツニュースの検索システムを構築しているとしましょう。ユーザーが「テニスプレーヤーが選手権での勝利を祝う」と検索し、データベースから最も関連性の高い記事を見つける必要があるとします。各記事には、テキストのキャプションと画像が含まれています。これは、現代のスポーツ報道の典型的な例です。

あなたのシステムは、テキストクエリを受け取り、コーパスから最も関連性の高いマルチモーダルドキュメントのランク付けされたリストを返す必要があります。簡単そうに聞こえますが、すべての明白なアプローチを打ち砕く根本的な問題があります。

これらのドキュメントをランク付けしようとすると、次のようになります。例えば、あなたの埋め込みモデル (Embeddings) であるjina-clip-v2は、次のような類似度スコアを生成します。

記事 コンテンツタイプ 説明 類似度スコア
A テキスト ノバク・ジョコビッチが全豪オープンの決勝でストレート勝ち 0.72
A 画像 [トロフィーを持ち笑顔のプレーヤーの写真] 0.31
B テキスト 天候の遅延が屋外トーナメントのスケジュールに影響 0.23
B 画像 [ジャンプして祝うテニスプレーヤーの写真] 0.54

どちらの記事がより関連性が高いでしょうか?記事Aはテキストスコアが高いですが、画像スコアは低いです。記事Bはテキストスコアが低いですが、画像スコアは高いです。根本的な課題は、0.72(テキスト)と0.54(画像)を比較できないことです。なぜなら、これらの類似度スコアは完全に異なるスケール上に存在するためです。

tag自明な解決策が失敗する場合

CLIPモデルにおけるテキストと画像のモダリティギャップとは何か、そしてなぜそれが重要なのか
CLIPモデルを使用してテキストと画像を取得し、スコアで結果を並べ替えることはできません。なぜでしょうか?それは、モダリティギャップがあるからです。それは何であり、どこから来るのでしょうか?
Jina AIBo Wang, Scott Martens

jina-clip-v2または他のほとんどすべてのCLIPのようなモデルにおけるモダリティギャップのため、試す可能性のある明白なアプローチはどれも機能しません。より高いスコアを使用するだけの場合、テキストスコアは0.2〜0.8の周辺に集中し、画像スコアは0.4〜0.6の周辺に集中するという事実に突き当たります。これは、平凡なテキストの一致(0.6)が常に優れた画像の一致(0.5)を打ち負かすことを意味します。

スコアを平均化しても役に立ちません。(0.7 + 0.3)/ 2 = 0.5を計算しても数値が得られますが、それは実際に何を意味するのでしょうか?あなたは根本的に意味のない量を平均化しています。同様に、固定の重み付けスキームも任意です。テキストがより重要な場合もあれば、画像がより重要な場合もあり、これは特定のクエリとドキュメントに完全に依存します。

最初にスコアを正規化しても、根本的な問題は解決されません。それでも、関連性の異なる側面を捉える根本的に異なる類似度指標を組み合わせようとしています。

tag実際に起こること

EDIS:マルチモーダルWebコンテンツ上のエンティティ駆動型画像検索
画像検索メソッドを実際の検索アプリケーションに実用化するには、データセットの規模、エンティティの理解、およびマルチモーダル情報の融合において大きな進歩が必要です。本研究では、ニュースドメインにおけるクロスモーダル画像検索のための挑戦的なデータセットである、\textbf{E}ntity-\textbf{D}riven \textbf{I}mage \textbf{S}earch(EDIS)を紹介します。EDISは、実際の検索エンジンの結果とキュレーションされたデータセットからの100万枚のWeb画像で構成されており、各画像にはテキストによる説明が組み合わされています。少数のシングルモーダル候補を想定するデータセットとは異なり、EDISは、100万のマルチモーダル画像とテキストのペアを候補として含めることにより、実際のWeb画像検索シナリオを反映しています。EDISは、クロスモーダル情報融合とマッチングに同時に対処する検索モデルの開発を奨励します。正確なランキング結果を得るには、モデルは次のことを行う必要があります。1)テキストクエリから名前付きエンティティとイベントを理解する、2)エンティティを画像またはテキストの説明に接地する、3)テキストおよび視覚的な表現を効果的に融合する。私たちの実験結果は、EDISが多数のエンティティと大規模な候補セットで最先端の方法に挑戦していることを示しています。アブレーション研究は、テキスト機能を視覚機能と融合することが検索結果の改善に不可欠であることも証明しています。
arXiv.orgSiqi Liu

私たちが取り組んでいることをよりよく理解するために、EDISデータセットのドキュメントの例を示します。画像(ドイツのサッカーの試合)とキャプション(One More Field Where the Content Trails Germany)を示しています。

図1:画像とテキストコンテンツの両方を含むマルチモーダルドキュメントの例。2つのモダリティがあるため、特定のクエリに対して2つのセマンティックギャップ(クエリとテキストの間、およびクエリと画像の間に)が存在します。最良の結果を得るには、ドキュメントのテキストコンテンツを検索すべきでしょうか、それとも画像コンテンツを検索すべきでしょうか?

全体として、jina-clip-v2は、EDISデータセットでクエリとテキストを比較する場合、クエリと画像を比較する場合よりもはるかに高い類似性を示します。これは、モデルのトレーニング方法と、データセット自体が原因です。

図2:jina-clip-v2を使用した、クエリと画像(赤)およびクエリとテキスト(青)の間の類似度スコア。

したがって、ドキュメントを画像ではなくテキストに基づいて検索する方が論理的に思われます。そして、下のグラフでわかるように、テキストクエリ... for undocumented immigrants helping to establish legal status in the United Statesをコーパスのテキストコンテンツと比較すると、はるかに良い結果が得られます。実際、画像で検索すると、正解のドキュメント(黄色で強調表示)をまったく取得できません。

図3:top_kを3で使用する場合、jina-clip-v2のクエリとテキストの検索でのみ正解のドキュメント(黄色の枠線で強調表示)を取得できる例。

しかし、騙されてはいけません。クエリとテキストの方が高い類似度スコアを示していますが、クエリとテキスト、およびクエリと画像の類似度スコアは比較可能ではありません。jina-clip-v2を使用してEDISデータセットから32個のドキュメントを取得する場合、recall@10を見るとこれがわかります。明らかに、リコールはクエリと画像の方が高くなっています。

Recall@10
クエリとテキスト 14.55
クエリと画像 22.38

以下で確認できます。データセットからのクエリEar ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi.を使用する場合、画像コンテンツによってのみ正解のドキュメントを取得できます。テキストコンテンツで検索しても一致するものは返されません。

図4:top_kを3で使用する場合、jina-clip-v2のクエリと画像の検索でのみ正解のドキュメント(黄色の枠線で強調表示)を取得できる例。

類似度スコアからテキストでドキュメントを検索し、リコール率から画像でドキュメントを検索する必要がある場合、どちらを選ぶべきでしょうか?確かに、図3と4からは明確な勝者は見当たりません。どのモダリティが、クエリと探しているドキュメントとの間で最も近い一致を示すのでしょうか?そして、クエリからテキストへの検索とクエリから画像への検索の両方から候補をマージしたい場合、スコアを比較することさえできないのに、どのようにして上位の一致を意味のある形で選択できるのでしょうか?明らかに、jina-clip-v2だけでは不十分です。別のモデルを投入する必要があります。

tagシンプルな2段階パイプライン

2025年4月、ビジュアルドキュメントを検索するための多言語マルチモーダル重排器 (Reranker) であるjina-reranker-m0をリリースしました。以下の図で、そのモダリティギャップが狭まっていることがわかります。jina-reranker-m0は、クエリからテキストへの類似度スコアとクエリから画像への類似度スコアが同程度であることを示していますが、jina-clip-v2では、そのギャップがはるかに大きくなっています。

図6:jina-clip-v2と比較して、jina-reranker-m0は、クエリから画像への類似度スコア(赤)とクエリからテキストへの類似度スコア(青)の差がはるかに小さいことを示しています。

これを念頭に置いて、jina-clip-v2から初期結果を取得した後、検索チェーンの2回目のパスでjina-reranker-m0を使用できます。

ステージ1:両方のモダリティから候補を取得する

  • jina-clip-v2を使用して、テキスト検索で16個のドキュメント、画像検索で16個のドキュメントを取得します。
  • まだスコアを比較できないことを受け入れます。

ステージ2:統合された重み付け

  • 各(クエリ+完全なドキュメント)ペアをjina-reranker-m0に入力します。
  • 重排器 (Reranker) は、テキストと画像の両方をまとめて処理します。
  • 出力:統一されたスケールでの単一の関連性スコア
図5:jina-clip-v2とjina-reranker-m0を使用したマルチモーダルドキュメントのインデックス作成と2段階のマルチモーダル検索プロセス。

表1の実験を拡張し、jina-clip-v2を使用してコーパスからドキュメントを取得し、次にjina-reranker-m0を使用してそれらを重み付けします。

  1. クエリからテキストへの検索で32個のドキュメントを取得し、次にクエリからテキストへのスコアに基づいて重み付けします。
  2. クエリから画像への検索で32個のドキュメントを取得し、次にクエリから画像へのスコアに基づいて重み付けします。
  3. クエリからテキストへの検索で16個のドキュメント、クエリから画像への検索で16個のドキュメントを取得します。クエリのモダリティに応じて、クエリからテキストへのスコアまたはクエリから画像へのスコアに基づいて重み付けします。
  4. クエリからテキストへの検索で16個のドキュメント、クエリから画像への検索で16個のドキュメントを取得します。各ドキュメントの平均クエリからテキストへのスコアとクエリから画像へのスコアに基づいて重み付けし、(クエリからテキストへのスコア+クエリから画像へのスコア)/2の最終スコアを与えます。
💡
EDISでのゼロショット性能を測定していることに注意してください。データセットを使用してjina-clip-v2またはjina-reranker-m0のいずれもファインチューニングしていません。
実験 説明 Recall@10 - jina-clip-v2を使用 Recall@10 - jina-reranker-m0を使用
1 32ドキュメント:クエリからテキストへ 14.55 17.42
2 32ドキュメント:クエリから画像へ 22.38 28.94
3 16ドキュメント:クエリからテキストへ
16ドキュメント:クエリから画像へ
14.55 33.81
4 16ドキュメント:クエリからテキストへ
16ドキュメント:クエリから画像へ
組み合わせた平均重排器 (Reranker) スコア
14.55 36.24
💡
実験1、3、4はすべて、クエリからテキストへのスコアがクエリから画像へのスコアよりも高いため、jina-clip-v2で同じリコール率@10の結果を示しています。したがって、上位10件の結果は、テキストを介して検索されたドキュメントによって支配されています。

ご覧のとおり、jina-reranker-m0で2回目のパスを実行することで、モダリティに関係なく、リコール率が全体的に向上します。ただし、検索されたドキュメントからテキストコンテンツと画像コンテンツの両方を組み合わせると、最大の増加が見られ、リコール率@10は36.24になります。視覚的な例では、jina-reranker-m0は、テキストコンテンツまたは画像コンテンツを検索するかどうかにかかわらず、一貫してグラウンドトゥルースドキュメントを最初にランク付けすることが示されています。

図7:サンプルクエリ(左側)と、各重み付け方法(右側の4つの列)の1つの結果のtop_kを示しており、画像とテキストの類似度スコアを組み合わせることで、一貫してグラウンドトゥルースドキュメントが最初にランク付けされることがわかります。
💡
図3と4は、さまざまな検索方法のtop_kが3であることを示していますが、スペースの都合上、図7は各クエリのtop_kのみを示しています。

tag結論

このシンプルな2段階アプローチは、システムがついに人間が自然に行うことを活用する(関連性を判断するために、私たちが読んだものと見たものの両方を考慮する)ため、リコール率が62%向上します。この教訓は検索にとどまりません。マルチモーダルAIシステムを扱う場合、モダリティを別々に扱うシングルパスアプローチは、常にこのスコアリングの非互換性の壁にぶつかります。広範に検索し、インテリジェントにランク付けする2段階アーキテクチャが不可欠になりつつあります。APIまたはAWS、GCP、Azure経由でjina-reranker-m0をお試しください。

カテゴリー:
技術ブログ
rss_feed

続きを読む
3月 11, 2026 • 7 読む時間
Bootstrapping Audio Embeddings from Multimodal LLMs
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
3月 06, 2026 • 6 読む時間
Identifying Embedding Models from Raw Numerical Values
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
9月 09, 2025 • 11 読む時間
Multimodal Embeddings in Llama.cpp and GGUF
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
現在の言語 / テーマ
Search Foundation
Reader
Embeddings
Reranker
Jina APIキーを取得する
レート制限
私たちについて
ニュース
Jinaロゴをダウンロード
open_in_new
Elasticロゴをダウンロード
open_in_new
APIステータス
Elastic © 2026.セキュリティ利用規約プライバシーCookieを管理する私の個人情報を販売したり、共有したりしないでください。
このウェブサイトおよび関連するすべてのコンテンツ、ソフトウェア、製品、サービスは、専門家による利用のみを目的としています。一般消費者向けのものではなく、一般消費者による利用も推奨されていません。