Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
當簡單的解決方案失敗時
實際發生了什麼
一個簡單的兩階段流程
結論
技術部落格
五月 25, 2025

使用 jina-reranker-m0 為多模態文件進行公平評分

文本相似度:0.7。圖片相似度:0.5。哪個文件更相關?你根本無法判斷 —— 而這正是打破多模態搜尋的核心問題。我們透過統一重排 (Reranker) 來解決它。
Nan Wang, Alex C-G • 8 分鐘閱讀

假設您正在建立一個體育新聞搜尋系統。使用者搜尋「網球選手慶祝冠軍勝利」,而您需要從資料庫中找到最相關的文章。每篇文章都包含文字說明和圖片——這是現代體育報導的典型特徵。

您的系統需要接收一個文字查詢 (text query),並從您的語料庫中返回一個排序過的、最相關的多模態文檔 (ranked list of the most relevant multimodal documents)列表。聽起來很簡單,但這裡存在一個根本性的問題,它打破了所有顯而易見的方法。

以下是您嘗試對這些文檔進行排序時會發生的情況。您的 向量模型 (Embeddings) 比如說 jina-clip-v2 會產生如下的相似度分數:

文章 內容類型 描述 相似度分數
A 文字 諾瓦克·喬科維奇在澳洲網球公開賽決賽中直落三盤獲勝 0.72
A 圖片 [球員手持獎盃微笑的照片] 0.31
B 文字 天氣延誤影響戶外錦標賽賽程 0.23
B 圖片 [網球選手跳躍慶祝的照片] 0.54

哪篇文章更相關?文章 A 的文字分數很高,但圖片分數很低。文章 B 的文字分數很低,但圖片分數較高。根本的挑戰在於,您無法比較 0.72(文字)和 0.54(圖片),因為這些相似度分數存在於完全不同的尺度上。

tag當簡單的解決方案失敗時

The What and Why of Text-Image Modality Gap in CLIP Models
You can’t just use a CLIP model to retrieve text and images and sort the results by score. Why? Because of the modality gap. What is it, and where does it come from?
Jina AIBo Wang, Scott Martens

由於 jina-clip-v2 或幾乎所有其他類似 CLIP 的模型中存在模態差距 (modality gap),您可能嘗試的任何顯而易見的方法都行不通。如果您僅使用較高的分數,您會遇到文字分數聚集在 0.2-0.8 之間,而圖片分數聚集在 0.4-0.6 之間的事實。這意味著平庸的文字匹配(0.6)總是會勝過優秀的圖片匹配(0.5)。

平均分數也無濟於事。計算 (0.7 + 0.3)/2 = 0.5 給你一個數字,但它實際上意味著什麼?您正在平均一些根本沒有意義的量。同樣,任何固定的加權方案都是任意的——有時文字更重要,有時圖片更重要,這完全取決於具體的查詢 (Prompt) 和文檔。

即使首先對分數進行歸一化也無法解決核心問題。您仍然試圖組合根本不同的相似性度量,這些度量捕捉了相關性的不同方面。

tag實際發生了什麼

EDIS: Entity-Driven Image Search over Multimodal Web Content
Making image retrieval methods practical for real-world search applications requires significant progress in dataset scales, entity comprehension, and multimodal information fusion. In this work, we introduce \textbf{E}ntity-\textbf{D}riven \textbf{I}mage \textbf{S}earch (EDIS), a challenging dataset for cross-modal image search in the news domain. EDIS consists of 1 million web images from actual search engine results and curated datasets, with each image paired with a textual description. Unlike datasets that assume a small set of single-modality candidates, EDIS reflects real-world web image search scenarios by including a million multimodal image-text pairs as candidates. EDIS encourages the development of retrieval models that simultaneously address cross-modal information fusion and matching. To achieve accurate ranking results, a model must: 1) understand named entities and events from text queries, 2) ground entities onto images or text descriptions, and 3) effectively fuse textual and visual representations. Our experimental results show that EDIS challenges state-of-the-art methods with dense entities and a large-scale candidate set. The ablation study also proves that fusing textual features with visual features is critical in improving retrieval results.
arXiv.orgSiqi Liu

為了更好地了解我們正在處理的問題,這裡有一個來自 EDIS 數據集的文檔範例,展示了圖片(一場德國足球比賽)和標題(One More Field Where the Content Trails Germany)。

圖 1:包含圖片和文字內容的多模態文檔範例。由於我們有兩種模態,對於任何給定的查詢 (Prompt),現在都有兩個語義差距(查詢 (Prompt) 和文字之間,以及查詢 (Prompt) 和圖片之間)。為了獲得最佳結果,我們應該搜尋文檔的文字內容,還是圖片內容?

總體而言,jina-clip-v2 在比較查詢 (Prompt) 到文字時顯示出比查詢 (Prompt) 到圖片更高的相似度,部分原因是模型的訓練方式,部分原因是數據集本身:

圖 2:使用 jina-clip-v2時,查詢 (Prompt) 到圖片(紅色)和查詢 (Prompt) 到文字(藍色)之間的相似度分數。

因此,根據文檔的文字而不是圖片來檢索文檔似乎是合乎邏輯的。而且,正如我們在下面的圖形中看到的那樣,當我們將文字查詢 (Prompt) ... for undocumented immigrants helping to establish legal status in the United States 與語料庫的文字內容進行比較時,我們獲得了更好的結果。事實上,按圖片搜尋根本無法檢索到真實文檔(黃色突出顯示):

圖 3:當使用 top_k 為 3 時,只能通過 jina-clip-v2 的查詢 (Prompt) 到文字檢索來檢索真實文檔(黃色邊框突出顯示)的範例。

但不要被愚弄了。儘管查詢 (Prompt) 到文字顯示出更高的相似度分數,但查詢 (Prompt) 到文字和查詢 (Prompt) 到圖片的相似度分數並不具有可比性。當我們使用 jina-clip-v2 從 EDIS 數據集中檢索 32 個文檔時,我們可以通過查看 recall@10 來看到這一點。顯然,通過查詢 (Prompt) 到圖片,召回率更高:

Recall@10
Query-to-text 14.55
Query-to-image 22.38

我們可以在下面看到:如果我們使用來自數據集的查詢 (Prompt):Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi.,我們只能通過其圖片內容來檢索真實文檔。通過其文字內容進行搜尋不會返回任何匹配項:

圖 4:當使用 top_k 為 3 時,只能通過 jina-clip-v2 的查詢 (Prompt) 到圖片檢索來檢索真實文檔(黃色邊框突出顯示)的範例。

所以,如果相似度分數表示我們應該從文字中檢索文件,而召回率表示我們應該從圖像中檢索文件,我們應該選擇哪個?當然,圖 3 和圖 4 表明沒有明顯的勝出者。哪種模態真正呈現了我們的查詢和我們正在尋找的文件之間最接近的匹配?如果我們想要合併來自文字查詢和圖像查詢檢索的候選結果,如果我們甚至無法比較分數,我們該如何有意義地選擇最佳匹配?顯然,僅僅使用 jina-clip-v2 是不行的。我們需要投入另一個模型來解決這個問題。

tag一個簡單的兩階段流程

在 2025 年 4 月,我們發布了 jina-reranker-m0,這是一個用於檢索視覺文件的多語言多模態重排器 (Reranker)。我們可以在下面看到它較窄的模態差距,其中 jina-reranker-m0 顯示了可比較的文字查詢和圖像查詢相似度分數,這與 jina-clip-v2 顯示的更大差距形成對比:

圖 6:與 jina-clip-v2 相比,jina-reranker-m0 在文字查詢(紅色)和圖像查詢(藍色)相似度分數之間顯示的差異要小得多。

考慮到這一點,我們可以使用 jina-reranker-m0 在檢索鏈中進行第二輪處理,在從 jina-clip-v2 檢索到初始結果之後:

階段 1:從兩種模態檢索候選結果

  • 使用 jina-clip-v2 通過文字搜索獲得 16 個文件 + 通過圖像搜索獲得 16 個文件
  • 接受我們還無法比較分數的事實

階段 2:統一重排序

  • 將每個(查詢 + 完整文件)對輸入到 jina-reranker-m0 中
  • 重排器 (Reranker) 同時處理文字和圖像
  • 輸出:統一尺度上的單一相關性分數
圖 5:使用 jina-clip-v2 和 jina-reranker-m0 索引多模態文件和兩階段多模態檢索過程。

我們擴展了表 1 中的實驗,現在使用 jina-clip-v2 從語料庫中檢索文件,然後使用 jina-reranker-m0 對它們進行重排序:

  1. 通過文字查詢檢索 32 個文件,然後根據文字查詢分數進行重排序。
  2. 通過圖像查詢檢索 32 個文件,然後根據圖像查詢分數進行重排序。
  3. 通過文字查詢檢索 16 個文件,通過圖像查詢檢索 16 個文件。根據查詢模態,基於文字查詢或圖像查詢分數進行重排序。
  4. 通過文字查詢檢索 16 個文件,通過圖像查詢檢索 16 個文件。根據每個文件的平均文字查詢和圖像查詢分數進行重排序,得出最終分數(文字查詢 + 圖像查詢)/2。
💡
請注意,我們正在測量 EDIS 上的零樣本效能。我們沒有使用該數據集微調 jina-clip-v2 或 jina-reranker-m0。
Experiment Description Recall@10 - with jina-clip-v2 Recall@10 - with jina-reranker-m0
1 32 docs: query-to-text 14.55 17.42
2 32 docs: query-to-image 22.38 28.94
3 16 docs: query-to-text
16 docs: query-to-image
14.55 33.81
4 16 docs: query-to-text
16 docs: query-to-image
Combined average reranker scores
14.55 36.24
💡
由於文字查詢分數高於圖像查詢分數,實驗 1、3 和 4 在使用 jina-clip-v2 時,召回率 @10 均顯示相同的結果。因此,前十名的結果主要由通過文字檢索的文件組成。

正如我們所看到的,通過使用 jina-reranker-m0 執行第二輪處理,召回率全面提高,而當我們結合來自檢索文件的文字和圖像內容時,我們看到了最大的增長,達到了 36.24 的召回率 @10。一個視覺範例顯示,無論搜索文字還是圖像內容,jina-reranker-m0 始終將真實文件排在第一位:

圖 7:每個重排序方法的樣本查詢(左側)和 top_k 為 1 的結果(右側四列),顯示結合圖像和文字相似度分數始終將真實文件排在第一位。
💡
雖然圖 3 和圖 4 顯示了不同檢索方法的 top_k 為 3,但由於空間原因,圖 7 僅顯示每個查詢的 top_k 為 1。

tag結論

這種簡單的兩階段方法使召回率提高了 62%,因為該系統最終利用了人類自然的做法:同時考慮我們閱讀的內容和我們看到的內容來確定相關性。這個教訓不僅限於搜索:在處理多模態 AI 系統時,將模態分開處理的單階段方法始終會遇到這種評分不相容的問題。廣泛檢索然後智能排序的兩階段架構正變得至關重要。通過我們的 API 或在 AWS、GCP 和 Azure 上試用 jina-reranker-m0。

類別:
技術部落格
rss_feed

閱讀更多
三月 11, 2026 • 7 分鐘閱讀
Bootstrapping Audio Embeddings from Multimodal LLMs
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
三月 06, 2026 • 6 分鐘閱讀
Identifying Embedding Models from Raw Numerical Values
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
九月 09, 2025 • 11 分鐘閱讀
Multimodal Embeddings in Llama.cpp and GGUF
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。