傳統的電腦視覺模型通常專注於模仿人類的視覺感知。jina-embeddings-v4 採取了一種不同的方法:它結合了圖像和文字處理,以理解人們如何閱讀和解釋視覺呈現的資訊。與單純將文字數位化的 OCR 程式不同,它實際上解析了複雜的視覺材料,如資訊圖表、圖表、示意圖和表格——在這些文件中,文字和視覺元素都帶有語義。我們稱這些為「視覺豐富文件」。

如果我們僅使用 OCR 和文字 向量模型,我們將會錯失重要的資訊。如果我們使用在圖像-標題對上訓練的傳統 向量模型,我們將無法提取文字的語義。而且,對於像表格這樣的東西,我們必須知道文字的含義並且處理文字元素之間的空間關係才能正確處理它們。我們必須以視覺感知的方式處理它們,這就是為什麼它被稱為視覺文件檢索。

但是你必須能夠看到事物才能理解它們,對於 向量模型來說也是如此。圖像品質非常重要。

圖像品質的差異可能來自多個來源:照片失焦、光線條件差、移動造成模糊,以及有損壓縮演算法破壞細節。但是視覺豐富文件通常是「天生」數位的。它們由螢幕截圖、簡報投影片和精美 PDF 等組成——這些資料已經透過某種呈現或發布過程被渲染成圖像。有時,它們是實際紙張頁面的掃描,但如果製作精良,這些圖像不會受到現實世界場景圖片中普遍存在的問題的影響。

對於視覺豐富文件,主要的輸入品質問題是圖像解析度。太小,我們檢索所需的資訊就會遺失。但太大,我們就會用虛假的細節淹沒模型,從而破壞準確的處理。適當調整輸入到 jina-embeddings-v4 的大小將節省您的資金並改善您的檢索結果。
本文著眼於 jina-embeddings-v4 如何處理圖像,以及圖像解析度對其檢索視覺豐富文件能力之影響。我們在 Hugging Face 上的 JinaVDR 儲存庫中提供了程式碼,以重現我們的結果或測試您自己的資料,如果您想自己應用本文中的想法。
tag視覺語言模型
jina-embeddings-v4 是一種視覺語言模型 (VLM),它擴展了 Qwen2.5-VL-3B-Instruct VLM。這種嵌入圖像的方法不同於單模態圖像或文字模型,以及像 jina-clip-v2 這樣的 CLIP 樣式模型。
圖 5 是 jina-embeddings-v4 模型架構的示意圖。骨幹模型類似於傳統的基於 Transformer 的 向量模型,只是它支援雙重輸出模式:由解碼器最後一層的均值池化產生的單向量(密集向量)嵌入,以及由與輸入大小相同的投影層產生的多向量(後期交互)輸出。
對於文字,其輸入與傳統的文字 向量模型相同:文字被 詞元 化,並且 詞元 被從查找表中替換為 向量。這些 詞元 向量一起作為模型的輸入。
VLM 的創新之處在於它們對圖像的處理:傳統的圖像 向量模型連接到文字 向量模型,但它不是通過均值池化產生圖像嵌入,而是將其最後一層作為文字 向量模型的輸入,就像它只是一個 詞元 向量序列一樣。

這意味著大型圖像對於 向量模型來說存在與長文字相同的問題。更長的輸入會增加計算成本和編碼時間,並且通常會產生無意義的嵌入。小圖像則存在相反的問題:如果太多資訊被壓縮到一個圖塊中,它會在嵌入過程中被衰減,並且在單向量嵌入中遺失,而對於多向量嵌入,它會降低匹配的強度。在提供給模型的資訊量與其準確提取相關資訊的能力之間存在權衡。
但是文字無法調整大小;圖像可以。
tagjina-embeddings-v4 中的圖像預處理
當您將圖像提交到 jina-embeddings-v4 時,它會被分割成 28x28 像素的圖塊。這意味著圖塊的數量與圖像的大小大致成正比。如果您使用 Jina API,則支援的最大大小為 602,112 像素,但如果您下載它,則它在模型程式碼中是一個用戶可設定的參數。
VLM 架構意味著模型可以支援的 28x28 圖像圖塊的數量等於它可以支援的文字 詞元 的數量。這將圖像大小的絕對上限設定在大約 20 百萬像素。

tag影像解析度實驗
我們使用 jina-embeddings-v4,透過 ViDoRe v1 和 v2 套件,以及 JinaVDR 基準測試套件的一部分,評估了不同的影像解析度,同時考量單向量和多向量輸出。調整模型的 max_pixels 參數到高達 19,267,584 像素(即 5,376x3,584)的值範圍,會產生來自不同影像解析度的 向量模型。如果影像已經小於 max_pixels 的值,則不會變更。
tagViDoRe v1
表 1 報告了五種解析度在個別 ViDoRe v1 基準測試上的單向量(密集向量) 向量模型 檢索結果(平均 nDCG@5 分數)。我們僅報告高達 9,633,792 像素的值,因為 ViDoRe v1 中沒有影像大於該值。

| 基準測試資料集 | 301,056 px | 602,112 px | 1,204,224 px | 2,408,448 px | 4,816,896 px | 9,633,792 px |
|---|---|---|---|---|---|---|
| 向量模型 中 詞元 的最大向量大小 | 384 | 768 | 1,536 | 3,072 | 6,144 | 12,288 |
arxivqa_test_subsampled |
0.83487 | 0.84529 | 0.84537 | 0.83785 | 0.83439 | 0.83469 |
docvqa_test_subsampled |
0.47366 | 0.50715 | 0.52421 | 0.51075 | 0.50287 | 0.50258 |
infovqa_test_subsampled |
0.84404 | 0.87510 | 0.87890 | 0.87978 | 0.87672 | 0.87710 |
shiftproject_test |
0.77524 | 0.81494 | 0.83988 | 0.84427 | 0.84127 | 0.84196 |
syntheticDocQA_artificial_intelligence_test |
0.93809 | 0.96786 | 0.96655 | 0.97155 | 0.97024 | 0.97024 |
syntheticDocQA_energy_test |
0.86865 | 0.89540 | 0.89847 | 0.91172 | 0.91286 | 0.91286 |
syntheticDocQA_government_reports_test |
0.91708 | 0.93417 | 0.93865 | 0.92309 | 0.91609 | 0.91609 |
syntheticDocQA_healthcare_industry_test |
0.93865 | 0.96428 | 0.96024 | 0.96542 | 0.95417 | 0.95286 |
tabfquad_test_subsampled |
0.94298 | 0.94853 | 0.94502 | 0.94505 | 0.94505 | 0.94612 |
tatdqa_test |
0.58622 | 0.64832 | 0.65867 | 0.65985 | 0.65395 | 0.65498 |
| 平均 | 0.81195 | 0.84010 | 0.84560 | 0.84493 | 0.84076 | 0.84095 |
您可以從表 1 中看到,最高的解析度遠非最佳。960 萬像素在測試中的表現低於最佳解析度,除了沒有影像大於 480 萬像素的測試外,它獲得了相同的分數,因為沒有調整大小。平均表現最佳的是 120 萬像素,而在不同基準測試中獲得最多最佳分數的解析度是 240 萬像素。
如果我們採用每個基準測試的最佳分數並計算平均值,我們會得到 0.84905。這僅比 120 萬像素的分數高出 0.345%。
如表 2 所示,使用多向量 向量模型,我們的檢索分數顯著提高。多向量匹配通常比單向量匹配表現更好。然而,不同解析度的性能大致相同。
| 基準測試資料集 | 301,056 px | 602,112 px | 1,204,224 px | 2,408,448 px | 4,816,896 px | 9,633,792 px |
|---|---|---|---|---|---|---|
| 向量模型 中 詞元 的最大向量大小 | 384 | 768 | 1,536 | 3,072 | 6,144 | 12,288 |
arxivqa_test_subsampled |
0.87456 | 0.88881 | 0.88736 | 0.88531 | 0.88899 | 0.89052 |
docvqa_test_subsampled |
0.55344 | 0.61284 | 0.61123 | 0.59941 | 0.59087 | 0.59229 |
infovqa_test_subsampled |
0.88777 | 0.92646 | 0.93376 | 0.94007 | 0.93459 | 0.93533 |
shiftproject_test |
0.86224 | 0.90563 | 0.93547 | 0.92847 | 0.92240 | 0.92240 |
syntheticDocQA_artificial_intelligence_test |
0.99631 | 0.99131 | 0.99500 | 0.99262 | 0.99262 | 0.99262 |
syntheticDocQA_energy_test |
0.95216 | 0.96524 | 0.96524 | 0.96893 | 0.96762 | 0.96762 |
syntheticDocQA_government_reports_test |
0.95934 | 0.97085 | 0.97524 | 0.98024 | 0.96655 | 0.96655 |
syntheticDocQA_healthcare_industry_test |
0.97893 | 0.97893 | 0.99631 | 0.98524 | 0.98393 | 0.98393 |
tabfquad_test_subsampled |
0.95386 | 0.95732 | 0.95611 | 0.95379 | 0.95379 | 0.95379 |
tatdqa_test |
0.70547 | 0.78534 | 0.79516 | 0.80422 | 0.80552 | 0.80727 |
| 平均 | 0.87241 | 0.89827 | 0.90509 | 0.90383 | 0.90069 | 0.90123 |
與單向量 向量模型 一樣,120 萬像素解析度具有最高的平均分數,而 240 萬像素是最大數量個別資料集的最佳分數解析度。所有基準測試中最佳分數的平均值為 0.90853,而 120 萬像素解析度的平均分數低了 0.344%,幾乎與單向量情況完全相同。
tagViDoRe v2
ViDoRe v2 使用比 ViDoRe v1 更詳細和色彩鮮豔的影像,這表明最佳解析度可能會更高。

我們在 ViDoRe v2 基準測試套件上測試了來自 jina-embeddings-v4 的多向量 向量模型,結果如表 3 所示。單向量結果相似但分數較低,因此我們在此省略它們。
| 基準測試資料集 | 150,528 px | 301,056 px | 602,112 px | 1,204,224 px | 2,408,448 px | 4,816,896 px | 9,633,792 px |
|---|---|---|---|---|---|---|---|
| 向量模型 中 詞元 的最大向量大小 | 192 | 384 | 768 | 1,536 | 3,072 | 6,144 | 12,288 |
esg_reports_v2 |
0.40444 | 0.54013 | 0.52005 | 0.51916 | 0.49953 | 0.52664 | 0.51442 |
biomedical_lectures_v2 |
0.58760 | 0.60479 | 0.6184 | 0.60748 | 0.60748 | 0.60748 | 0.60748 |
economics_reports_v2 |
0.47666 | 0.50399 | 0.54216 | 0.54998 | 0.54998 | 0.54998 | 0.54998 |
esg_reports_human_labeled_v2 |
0.42171 | 0.56940 | 0.61227 | 0.57307 | 0.61108 | 0.63858 | 0.64921 |
| 平均 | 0.47260 | 0.55458 | 0.57322 | 0.56242 | 0.56702 | 0.58067 | 0.58027 |
在這種情況下,平均表現最佳的是 480 萬像素解析度,而 960 萬像素的平均性能基本相同。儘管如此,對於四個基準測試中的三個,最高解析度的表現都比低解析度差,除非在一個沒有影像大於 480 萬像素的測試中。
tag高解析度基準測試
ViDoRe v1 和 ViDoRe v2 包含具有相似原始解析度的影像,因此我們從 JinaVDR 套件中提取了兩個包含非常高解析度、難以處理影像的基準測試,並對它們執行了相同的多向量 向量模型 測試。
一個是 europeana-de-news 基準測試,其中包含 17 世紀至 20 世紀德國報紙的高解析度掃描件;另一個是 wikimedia-commons-maps 基準測試,其中包含印刷地圖的超高解析度掃描件,其中大部分來自前數位時代。

wikimedia-commons-maps 中。(右) Hamburger Nachrichten 報紙的頭版,日期為 1819 年 4 月 26 日,包含在 europeana-de-news 中,掃描為 4324x4738 像素。如表 4 所示,結果非常複雜。
| 基準資料集 | 301,056 px | 602,112 px | 1,204,224 px | 2,408,448 px | 4,816,896 px | 9,633,792 px | 19,267,584 px |
|---|---|---|---|---|---|---|---|
| 詞元中向量模型最大大小 | 384 | 768 | 1,536 | 3,072 | 6,144 | 12,288 | 24,576 |
europeana-de-news |
0.46319 | 0.59457 | 0.66802 | 0.66550 | 0.66407 | 0.63948 | 0.65208 |
wikimedia-commons-maps |
0.23671 | 0.34421 | 0.42835 | 0.52268 | 0.53464 | 0.53464 | 0.53588 |
| 平均 | 0.34995 | 0.46939 | 0.54819 | 0.59409 | 0.59936 | 0.58706 | 0.59398 |
報紙資料顯然不需要與地圖資料相同的解析度。這可能是因為地圖中的文字相對於整體影像大小來說非常小,而且確實需要可讀才能使檢索工作正常運作。當報紙掃描的大小大於最佳大小時,效能會波動並下降。
平均值對於兩者來說都不是最佳的,這表明沒有一個正確的解析度可以解決問題。正是這個發現推動了我們接下來的行動。
tag多重解析度向量模型
jina-embeddings-v4 的 VLM 架構以處理文字詞元的方式處理影像的個別區塊,因此我們可以輕鬆地使用低解析度的區塊來擴充高解析度的區塊。這只意味著更多的輸入資料,只要我們保持在模型支援的最大值範圍內。如果較低解析度產生比高解析度更好的語義,我們可以將它們包含在內,而無需擔心最佳解析度是多少。
為了驗證這個假設,我們研究了三種解析度的組合:
| 混合 1 | 混合 2 | 混合 3 | |
|---|---|---|---|
| 詞元總數上限 | 2,880 | 5,234 | 12,096 |
| 解析度 | 150,528 px<br>301,056 px<br>602,112 px<br>1,204,224 px | 50,000 px<br>90,000 px<br>160,000 px<br>250,000 px<br>360,000 px<br>490,000 px<br>602,112 px<br>900,000 px<br>1,204,224 px | 150,528 px<br>301,056 px<br>602,112 px<br>1,204,224 px<br>2,408,448 px<br>4,816,896 px |
這意味著,當我們測試混合 1時,我們會將每個影像調整為四種不同的解析度(150,528 px、301,056 px、602,112 px、1,204,224 px),並將每個影像單獨處理成多向量模型,然後在進行查詢匹配之前串聯結果。混合 2 和 混合 3 也是如此,但解析度不同。我們在 ViDoRe v2 基準上嘗試了所有三種組合,總結於表 6 中。
| 基準資料集 | 最佳單一解析度 | 混合 1 | 混合 2 | 混合 3 |
|---|---|---|---|---|
| 詞元中向量模型最大大小 | — | 2,880 | 5,234 | 12,096 |
esg_reports_v2 |
0.54013 | 0.58354 | 0.59252 | 0.56567 |
biomedical_lectures_v2 |
0.61840 | 0.61678 | 0.61714 | 0.61638 |
economics_reports_v2 |
0.54998 | 0.54997 | 0.55534 | 0.55049 |
esg_reports_human_labeled_v2 |
0.64921 | 0.67726 | 0.68057 | 0.66734 |
| 平均 | 0.58943 | 0.60689 | 0.61139 | 0.59997 |
對於所有 ViDoRe v2 基準,混合 2 的效能優於混合 1 和 3,這表明更多不同的解析度產生的結果比新增更高解析度更好。在四個基準中的兩個中,所有解析度混合都優於最佳單一解析度,而對於剩下的兩個,只有混合 1 的效能較差,而且差距不大。
這些結果表明,雖然沒有適用於所有資料的最佳解析度混合,但確定良好的解析度混合是找到最佳解決方案的正確方向。
tag結論
在處理視覺上豐富的材料時,影像解析度對於 jina-embeddings-v4 來說非常重要。一個關鍵問題是文字的大小應該可讀。如果看不懂,AI 也看不懂,如果文字很重要,那就必須看得懂。
但是,解析度太高會使向量模型難以將影像區塊組合成一個連貫的整體。而且成本也很高:更高的解析度意味著更多的處理,而且對於多向量模型來說,意味著更多的儲存空間和更慢的匹配。
使用多個解析度並對所有輸出一起應用延遲互動式評分,是處理具有不同大小的視覺上豐富的影像的好方法。但是,這會增加處理和儲存成本,並像非常高的解析度一樣減慢檢索速度。
我們正在研究如何將這種洞察力應用於實際操作中,以改善神經搜尋。我們不斷嘗試使我們的訓練和測試資料多樣化,以探測我們模型的缺點並設計改進方法。我們正在研究解析度和多重解析度技術(如本文所述)對各種材料的影響。
我們也在進行實驗,以查看像這裡描述的多重解析度技術是否可以減輕影像中的雜訊影響,並產生更穩健的檢索。
此外,有可能預先自動確定每個影像的最佳解析度。如果我們可以可靠地檢測到最佳解析度,它將消除使用者的一個參數,同時改善整體結果,使向量模型更易於訪問和使用。






