I/O 圖 1
I/O 圖 2
I/O 圖 3
I/O 圖 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
LongEmbed
69.88
Parameters
3.8B
Rank by score
7 / 69
Pareto front
Behind it
取值分佈help_outlineAUC 0.8308
語料
翻譯對
文件檢索
程式碼
影象 / 頭圖
影象 / 標識
任務
code.passage
code.query
code.query → code.passage
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
相關6.7%
困難負例1.1%
無關0.8%
推薦閾值
FPR 0.1 · 0.714
FPR 0.01 · 0.836
FPR 0.001 · 0.877
FPR 0.0001 · 0.896
均衡 · 0.618
AUC
0.8308
噪聲上限
0.877
召回懸崖
0.516
測量樣本對
119 / 11k
向量分量help_outline
σ 0.0221 · 487k 個數值
嵌入幾何help_outline
各維度均值,懸停檢視區間
噪聲下限
0.496
有效維度
73 / 2048
維度截斷help_outline
text-matching · 閾值隨所請求維度的變化
語言對help_outline
各語言對之間的閾值跨度:0.069
選擇要比較的模型
論文 (2)
概述
Jina Embeddings V4 是一款 38 億參數的多模態向量模型,可統一表示文本與圖像。它基於 Qwen2.5-VL-3B-Instruct 主幹網路構建,架構上同時支援單向量和遲交互式的多向量輸出,突破了傳統 CLIP 式雙編碼器模型的侷限。模型整合了三個面向特定任務的 LoRA 適配器(各 6000 萬參數),無需改動凍結的主幹網路權重,即可針對非對稱查詢-文件檢索、語義文本相似度和程式碼搜尋等不同場景最佳化效果。憑藉統一的處理路徑,它在表格、圖表、示意圖、螢幕截圖及圖文混排等視覺資訊豐富的內容上表現出色,顯著縮小了傳統架構中的模態鴻溝。該模型支援多語言,輸入文本最長 32,768 詞元,圖像可縮放至 2000 萬像素,適用於跨語言、跨領域的各類文件檢索與跨模態搜尋場景。
方法
Jina Embeddings V4 採用統一的多模態語言模型架構,與 CLIP 式雙編碼器方案截然不同。輸入走同一條通路:影象先經視覺編碼器轉成詞元序列,隨後文字與影象兩種模態一起送入帶上下文注意力層的語言模型解碼器處理。該架構提供兩種輸出模式以適配不同場景:單向量模式透過均值池化生成 2048 維向量,可藉助 Matryoshka 表示學習截斷至 128 維,適合高效的相似度檢索;多向量模式則透過投影層為每個詞元輸出 128 維向量,用於遲互動式檢索。模型包含三個面向特定任務的 LoRA 介面卡,分別做針對性最佳化:檢索介面卡採用基於字首的非對稱編碼,並用難負樣本訓練,服務於查詢-文件場景;文字匹配介面卡採用 CoSENT 損失處理語義相似度任務;程式碼介面卡則專攻自然語言到程式碼的檢索。訓練分兩個階段:先用來自 300 多個來源的文字-文字、文字-影象樣本對,以 InfoNCE 對比損失做配對訓練;再用三元組方法和為各領域定製的損失函式,對三個 LoRA 介面卡做任務專項微調。
效能
Jina Embeddings V4 在多類基準測試中都交出了極具競爭力的成績。視覺文件檢索方面,JinaVDR 平均分 72.19,ColPali-v1.2 為 64.50;ViDoRe 平均分 84.11,ColPali 為 83.90,多向量模式在 ViDoRe 上更是達到 90.17。跨模態檢索方面,CLIP Benchmark 得分 84.11,jina-clip-v2 為 81.12,nllb-clip-large-siglip 為 83.19。文字檢索方面,MTEB-en 得 55.97,MMTEB 得 66.49;長文件處理表現突出,LongEmbed 達 67.11,上一代僅 55.66。語義文字相似度表現紮實,英文 STS 任務得 85.89,多語言 STS 得 72.70。程式碼檢索在 CoIR 上達 71.59,不過 voyage-code-3(77.33)等專用模型在該領域得分更高。跨模態對齊度提升明顯,得分 0.71,而 OpenAI CLIP 僅為 0.15,有效緩解了多模態模型的模態鴻溝問題。在視覺資訊豐富的任務上,多向量模式始終優於單向量模式;常規檢索場景下,單向量模式則更為高效。
最佳實踐
要用好 Jina Embeddings V4,請根據實際需求選擇合適的 LoRA 適配器。查詢與文件結構不同的非對稱檢索場景請用「retrieval」適配器,並記得加上正確前綴以區分查詢和段落內容。「text-matching」適配器適合語義相似度任務和對稱檢索,也就是找相似內容而非回答問題的場景,如文件聚類、查重和內容推薦。程式設計相關場景請用「code」適配器,它針對自然語言到程式碼的檢索、程式碼到程式碼的相似檢索以及技術問答做了最佳化。輸出模式請按效能和效率需求來選:單向量適合高效相似度檢索和儲存受限的環境,維度可從 2048 截斷到 128 至 512,品質損失在可接受範圍內;多向量則為複雜檢索任務提供更高精度,尤其在處理視覺資訊豐富的文件時,遲交互評分能捕捉更細緻的關聯。統一架構讓它能直接處理圖文混合輸入,視覺文件無需另配編碼器或做 OCR 預處理。跨模態對齊能力和多語言支援,也讓它很適合國際化應用。生產部署規劃記憶體時,請把每個 LoRA 適配器 6000 萬參數的開銷計算在內;三個適配器同時常駐僅增加不到 2% 的記憶體佔用,推理時可靈活切換任務。
提及此模型的部落格
Qwen 研究許可證 









