Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP terminal命令列articlellms.txtsmart_toy智慧體data_objectSchemamenu_book文件



登入
login
視覺語言模型
jina-embeddings-v4 中的圖像預處理
影像解析度實驗
多重解析度向量模型
結論
技術部落格
七月 31, 2025

圖像解析度如何影響視覺文件檢索

圖像解析度對於嵌入視覺上豐富的文件至關重要。解析度太小,模型會錯失關鍵細節;解析度太大,則無法連接各個部分。
Maximilian Werk, Michael Günther, Scott Martens • 12 分鐘閱讀

傳統的電腦視覺模型通常專注於模仿人類的視覺感知。jina-embeddings-v4 採取了一種不同的方法:它結合了圖像和文字處理,以理解人們如何閱讀和解釋視覺呈現的資訊。與單純將文字數位化的 OCR 程式不同,它實際上解析了複雜的視覺材料,如資訊圖表、圖表、示意圖和表格——在這些文件中,文字和視覺元素都帶有語義。我們稱這些為「視覺豐富文件」。

圖 1:來自 JinaVDR 基準測試集合的視覺豐富文件範例。

如果我們僅使用 OCR 和文字 向量模型,我們將會錯失重要的資訊。如果我們使用在圖像-標題對上訓練的傳統 向量模型,我們將無法提取文字的語義。而且,對於像表格這樣的東西,我們必須知道文字的含義並且處理文字元素之間的空間關係才能正確處理它們。我們必須以視覺感知的方式處理它們,這就是為什麼它被稱為視覺文件檢索。

圖 2:一個以圖像呈現的表格,來自 JinaVDR 基準測試集合。文字之間的空間關係對於理解表格的含義非常重要。

但是你必須能夠看到事物才能理解它們,對於 向量模型來說也是如此。圖像品質非常重要。

圖 3:來自 Patterson–Gimlin 電影的影格。是大腳怪嗎?模糊的熊?還是穿著大猩猩服裝的人?糟糕的圖像品質讓人難以判斷。

圖像品質的差異可能來自多個來源:照片失焦、光線條件差、移動造成模糊,以及有損壓縮演算法破壞細節。但是視覺豐富文件通常是「天生」數位的。它們由螢幕截圖、簡報投影片和精美 PDF 等組成——這些資料已經透過某種呈現或發布過程被渲染成圖像。有時,它們是實際紙張頁面的掃描,但如果製作精良,這些圖像不會受到現實世界場景圖片中普遍存在的問題的影響。

圖 4:改變圖像解析度的影響。最小的文字消失得最快,我們不能期望 向量模型理解模糊的文字。即使視覺內容,如果解析度足夠低也會遺失。

對於視覺豐富文件,主要的輸入品質問題是圖像解析度。太小,我們檢索所需的資訊就會遺失。但太大,我們就會用虛假的細節淹沒模型,從而破壞準確的處理。適當調整輸入到 jina-embeddings-v4 的大小將節省您的資金並改善您的檢索結果。

本文著眼於 jina-embeddings-v4 如何處理圖像,以及圖像解析度對其檢索視覺豐富文件能力之影響。我們在 Hugging Face 上的 JinaVDR 儲存庫中提供了程式碼,以重現我們的結果或測試您自己的資料,如果您想自己應用本文中的想法。

GitHub - jina-ai/jina-vdr: Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval
Jina VDR is a multilingual, multi-domain benchmark for visual document retrieval - jina-ai/jina-vdr
GitHubjina-ai

tag視覺語言模型

jina-embeddings-v4 是一種視覺語言模型 (VLM),它擴展了 Qwen2.5-VL-3B-Instruct VLM。這種嵌入圖像的方法不同於單模態圖像或文字模型,以及像 jina-clip-v2 這樣的 CLIP 樣式模型。

圖 5 是 jina-embeddings-v4 模型架構的示意圖。骨幹模型類似於傳統的基於 Transformer 的 向量模型,只是它支援雙重輸出模式:由解碼器最後一層的均值池化產生的單向量(密集向量)嵌入,以及由與輸入大小相同的投影層產生的多向量(後期交互)輸出。

有關 jina-embeddings-v4 及其兩種輸出模式的更多資訊,請參閱發布通知和技術報告。
圖 5:jina-embeddings-v4 的架構,來自第 4 版技術報告。

對於文字,其輸入與傳統的文字 向量模型相同:文字被 詞元 化,並且 詞元 被從查找表中替換為 向量。這些 詞元 向量一起作為模型的輸入。

VLM 的創新之處在於它們對圖像的處理:傳統的圖像 向量模型連接到文字 向量模型,但它不是通過均值池化產生圖像嵌入,而是將其最後一層作為文字 向量模型的輸入,就像它只是一個 詞元 向量序列一樣。

圖 6:jina-embeddings-v4 處理圖像與文字的方式比較。

這意味著大型圖像對於 向量模型來說存在與長文字相同的問題。更長的輸入會增加計算成本和編碼時間,並且通常會產生無意義的嵌入。小圖像則存在相反的問題:如果太多資訊被壓縮到一個圖塊中,它會在嵌入過程中被衰減,並且在單向量嵌入中遺失,而對於多向量嵌入,它會降低匹配的強度。在提供給模型的資訊量與其準確提取相關資訊的能力之間存在權衡。

但是文字無法調整大小;圖像可以。

tagjina-embeddings-v4 中的圖像預處理

當您將圖像提交到 jina-embeddings-v4 時,它會被分割成 28x28 像素的圖塊。這意味著圖塊的數量與圖像的大小大致成正比。如果您使用 Jina API,則支援的最大大小為 602,112 像素,但如果您下載它,則它在模型程式碼中是一個用戶可設定的參數。

VLM 架構意味著模型可以支援的 28x28 圖像圖塊的數量等於它可以支援的文字 詞元 的數量。這將圖像大小的絕對上限設定在大約 20 百萬像素。

圖 7:解析度如何影響圖塊的數量。

tag影像解析度實驗

我們使用 jina-embeddings-v4,透過 ViDoRe v1 和 v2 套件,以及 JinaVDR 基準測試套件的一部分,評估了不同的影像解析度,同時考量單向量和多向量輸出。調整模型的 max_pixels 參數到高達 19,267,584 像素(即 5,376x3,584)的值範圍,會產生來自不同影像解析度的 向量模型。如果影像已經小於 max_pixels 的值,則不會變更。

tagViDoRe v1

表 1 報告了五種解析度在個別 ViDoRe v1 基準測試上的單向量(密集向量) 向量模型 檢索結果(平均 nDCG@5 分數)。我們僅報告高達 9,633,792 像素的值,因為 ViDoRe v1 中沒有影像大於該值。

圖 8:ViDoRe v1 基準測試套件中的文件範例。
基準測試資料集 301,056 px 602,112 px 1,204,224 px 2,408,448 px 4,816,896 px 9,633,792 px
向量模型 中 詞元 的最大向量大小 384 768 1,536 3,072 6,144 12,288
arxivqa_test_subsampled 0.83487 0.84529 0.84537 0.83785 0.83439 0.83469
docvqa_test_subsampled 0.47366 0.50715 0.52421 0.51075 0.50287 0.50258
infovqa_test_subsampled 0.84404 0.87510 0.87890 0.87978 0.87672 0.87710
shiftproject_test 0.77524 0.81494 0.83988 0.84427 0.84127 0.84196
syntheticDocQA_artificial_intelligence_test 0.93809 0.96786 0.96655 0.97155 0.97024 0.97024
syntheticDocQA_energy_test 0.86865 0.89540 0.89847 0.91172 0.91286 0.91286
syntheticDocQA_government_reports_test 0.91708 0.93417 0.93865 0.92309 0.91609 0.91609
syntheticDocQA_healthcare_industry_test 0.93865 0.96428 0.96024 0.96542 0.95417 0.95286
tabfquad_test_subsampled 0.94298 0.94853 0.94502 0.94505 0.94505 0.94612
tatdqa_test 0.58622 0.64832 0.65867 0.65985 0.65395 0.65498
平均 0.81195 0.84010 0.84560 0.84493 0.84076 0.84095
當較高的解析度與較低的解析度並列時,表示該基準測試中沒有影像大於較低的解析度,因此未發生調整大小。

您可以從表 1 中看到,最高的解析度遠非最佳。960 萬像素在測試中的表現低於最佳解析度,除了沒有影像大於 480 萬像素的測試外,它獲得了相同的分數,因為沒有調整大小。平均表現最佳的是 120 萬像素,而在不同基準測試中獲得最多最佳分數的解析度是 240 萬像素。

如果我們採用每個基準測試的最佳分數並計算平均值,我們會得到 0.84905。這僅比 120 萬像素的分數高出 0.345%。

如表 2 所示,使用多向量 向量模型,我們的檢索分數顯著提高。多向量匹配通常比單向量匹配表現更好。然而,不同解析度的性能大致相同。

基準測試資料集 301,056 px 602,112 px 1,204,224 px 2,408,448 px 4,816,896 px 9,633,792 px
向量模型 中 詞元 的最大向量大小 384 768 1,536 3,072 6,144 12,288
arxivqa_test_subsampled 0.87456 0.88881 0.88736 0.88531 0.88899 0.89052
docvqa_test_subsampled 0.55344 0.61284 0.61123 0.59941 0.59087 0.59229
infovqa_test_subsampled 0.88777 0.92646 0.93376 0.94007 0.93459 0.93533
shiftproject_test 0.86224 0.90563 0.93547 0.92847 0.92240 0.92240
syntheticDocQA_artificial_intelligence_test 0.99631 0.99131 0.99500 0.99262 0.99262 0.99262
syntheticDocQA_energy_test 0.95216 0.96524 0.96524 0.96893 0.96762 0.96762
syntheticDocQA_government_reports_test 0.95934 0.97085 0.97524 0.98024 0.96655 0.96655
syntheticDocQA_healthcare_industry_test 0.97893 0.97893 0.99631 0.98524 0.98393 0.98393
tabfquad_test_subsampled 0.95386 0.95732 0.95611 0.95379 0.95379 0.95379
tatdqa_test 0.70547 0.78534 0.79516 0.80422 0.80552 0.80727
平均 0.87241 0.89827 0.90509 0.90383 0.90069 0.90123

與單向量 向量模型 一樣,120 萬像素解析度具有最高的平均分數,而 240 萬像素是最大數量個別資料集的最佳分數解析度。所有基準測試中最佳分數的平均值為 0.90853,而 120 萬像素解析度的平均分數低了 0.344%,幾乎與單向量情況完全相同。

tagViDoRe v2

ViDoRe v2 使用比 ViDoRe v1 更詳細和色彩鮮豔的影像,這表明最佳解析度可能會更高。

圖 9:ViDoRe v2 文件範例。

我們在 ViDoRe v2 基準測試套件上測試了來自 jina-embeddings-v4 的多向量 向量模型,結果如表 3 所示。單向量結果相似但分數較低,因此我們在此省略它們。

基準測試資料集 150,528 px 301,056 px 602,112 px 1,204,224 px 2,408,448 px 4,816,896 px 9,633,792 px
向量模型 中 詞元 的最大向量大小 192 384 768 1,536 3,072 6,144 12,288
esg_reports_v2 0.40444 0.54013 0.52005 0.51916 0.49953 0.52664 0.51442
biomedical_lectures_v2 0.58760 0.60479 0.6184 0.60748 0.60748 0.60748 0.60748
economics_reports_v2 0.47666 0.50399 0.54216 0.54998 0.54998 0.54998 0.54998
esg_reports_human_labeled_v2 0.42171 0.56940 0.61227 0.57307 0.61108 0.63858 0.64921
平均 0.47260 0.55458 0.57322 0.56242 0.56702 0.58067 0.58027

在這種情況下,平均表現最佳的是 480 萬像素解析度,而 960 萬像素的平均性能基本相同。儘管如此,對於四個基準測試中的三個,最高解析度的表現都比低解析度差,除非在一個沒有影像大於 480 萬像素的測試中。

tag高解析度基準測試

ViDoRe v1 和 ViDoRe v2 包含具有相似原始解析度的影像,因此我們從 JinaVDR 套件中提取了兩個包含非常高解析度、難以處理影像的基準測試,並對它們執行了相同的多向量 向量模型 測試。

一個是 europeana-de-news 基準測試,其中包含 17 世紀至 20 世紀德國報紙的高解析度掃描件;另一個是 wikimedia-commons-maps 基準測試,其中包含印刷地圖的超高解析度掃描件,其中大部分來自前數位時代。

圖 10:(左) 來自 18 世紀印刷品的 4000x2968 像素地圖,包含在 wikimedia-commons-maps 中。(右) Hamburger Nachrichten 報紙的頭版,日期為 1819 年 4 月 26 日,包含在 europeana-de-news 中,掃描為 4324x4738 像素。

如表 4 所示,結果非常複雜。

基準資料集 301,056 px 602,112 px 1,204,224 px 2,408,448 px 4,816,896 px 9,633,792 px 19,267,584 px
詞元中向量模型最大大小 384 768 1,536 3,072 6,144 12,288 24,576
europeana-de-news 0.46319 0.59457 0.66802 0.66550 0.66407 0.63948 0.65208
wikimedia-commons-maps 0.23671 0.34421 0.42835 0.52268 0.53464 0.53464 0.53588
平均 0.34995 0.46939 0.54819 0.59409 0.59936 0.58706 0.59398

報紙資料顯然不需要與地圖資料相同的解析度。這可能是因為地圖中的文字相對於整體影像大小來說非常小,而且確實需要可讀才能使檢索工作正常運作。當報紙掃描的大小大於最佳大小時,效能會波動並下降。

平均值對於兩者來說都不是最佳的,這表明沒有一個正確的解析度可以解決問題。正是這個發現推動了我們接下來的行動。

tag多重解析度向量模型

jina-embeddings-v4 的 VLM 架構以處理文字詞元的方式處理影像的個別區塊,因此我們可以輕鬆地使用低解析度的區塊來擴充高解析度的區塊。這只意味著更多的輸入資料,只要我們保持在模型支援的最大值範圍內。如果較低解析度產生比高解析度更好的語義,我們可以將它們包含在內,而無需擔心最佳解析度是多少。

為了驗證這個假設,我們研究了三種解析度的組合:

混合 1 混合 2 混合 3
詞元總數上限 2,880 5,234 12,096
解析度 150,528 px<br>301,056 px<br>602,112 px<br>1,204,224 px 50,000 px<br>90,000 px<br>160,000 px<br>250,000 px<br>360,000 px<br>490,000 px<br>602,112 px<br>900,000 px<br>1,204,224 px 150,528 px<br>301,056 px<br>602,112 px<br>1,204,224 px<br>2,408,448 px<br>4,816,896 px

這意味著,當我們測試混合 1時,我們會將每個影像調整為四種不同的解析度(150,528 px、301,056 px、602,112 px、1,204,224 px),並將每個影像單獨處理成多向量模型,然後在進行查詢匹配之前串聯結果。混合 2 和 混合 3 也是如此,但解析度不同。我們在 ViDoRe v2 基準上嘗試了所有三種組合,總結於表 6 中。

基準資料集 最佳單一解析度 混合 1 混合 2 混合 3
詞元中向量模型最大大小 — 2,880 5,234 12,096
esg_reports_v2 0.54013 0.58354 0.59252 0.56567
biomedical_lectures_v2 0.61840 0.61678 0.61714 0.61638
economics_reports_v2 0.54998 0.54997 0.55534 0.55049
esg_reports_human_labeled_v2 0.64921 0.67726 0.68057 0.66734
平均 0.58943 0.60689 0.61139 0.59997

對於所有 ViDoRe v2 基準,混合 2 的效能優於混合 1 和 3,這表明更多不同的解析度產生的結果比新增更高解析度更好。在四個基準中的兩個中,所有解析度混合都優於最佳單一解析度,而對於剩下的兩個,只有混合 1 的效能較差,而且差距不大。

這些結果表明,雖然沒有適用於所有資料的最佳解析度混合,但確定良好的解析度混合是找到最佳解決方案的正確方向。

tag結論

在處理視覺上豐富的材料時,影像解析度對於 jina-embeddings-v4 來說非常重要。一個關鍵問題是文字的大小應該可讀。如果看不懂,AI 也看不懂,如果文字很重要,那就必須看得懂。

但是,解析度太高會使向量模型難以將影像區塊組合成一個連貫的整體。而且成本也很高:更高的解析度意味著更多的處理,而且對於多向量模型來說,意味著更多的儲存空間和更慢的匹配。

使用多個解析度並對所有輸出一起應用延遲互動式評分,是處理具有不同大小的視覺上豐富的影像的好方法。但是,這會增加處理和儲存成本,並像非常高的解析度一樣減慢檢索速度。

我們正在研究如何將這種洞察力應用於實際操作中,以改善神經搜尋。我們不斷嘗試使我們的訓練和測試資料多樣化,以探測我們模型的缺點並設計改進方法。我們正在研究解析度和多重解析度技術(如本文所述)對各種材料的影響。

我們也在進行實驗,以查看像這裡描述的多重解析度技術是否可以減輕影像中的雜訊影響,並產生更穩健的檢索。

此外,有可能預先自動確定每個影像的最佳解析度。如果我們可以可靠地檢測到最佳解析度,它將消除使用者的一個參數,同時改善整體結果,使向量模型更易於訪問和使用。

類別:
技術部落格
rss_feed

閱讀更多
三月 11, 2026 • 7 分鐘閱讀
從多模態大模型引導音訊向量模型
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
三月 06, 2026 • 6 分鐘閱讀
從原始數值辨識向量模型
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
九月 09, 2025 • 11 分鐘閱讀
Llama.cpp 與 GGUF 中的多模態向量模型
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。