I/O 圖 1

文字

jina-clip-v2

向量

I/O 圖 2

圖片

jina-clip-v2

向量

帕累託前緣
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2參數量(對數)i2t-recall@5
本模型
在前緣上
Jina AI
其他
CLIP Benchmark
89.73
參數量
865M
按分數的排名
34 / 56
帕累託前緣
在前緣之後
取值分佈
AUC 0.8383
語料
翻譯對
文件檢索
圖片 / 頭圖
圖片 / 標識
任務
default
retrieval.query
0.6040.000.200.400.60
相關20.2%
困難負例3.6%
無關0.8%
推薦閾值
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
均衡 · 0.403
AUC
0.8383
噪聲上限
0.666
召回懸崖
0.224
測量樣本對
119 / 11k
向量分量
-0.43-0.070.29
σ 0.0313 · 244k 個數值
向量幾何
01024
各維度均值,懸停檢視區間
噪聲下限
0.420
有效維度
52 / 1024
語言對
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.064
選擇要比較的模型
論文 (2)

概述

jina-clip-v2 是一個 865M 參數的多語言多模態向量模型,支援 89 種語言和 512×512 圖片輸入。它在 jina-clip-v1 基礎上增加了跨語言圖文對齊、用於降維的 Matryoshka 表示學習(1024→64),以及在視覺豐富文件上的性能提升。它在跨語言圖片檢索上達到最先進水平,同時保持純文字和單模態上的強勁表現。

方法

該模型採用雙編碼器架構,將 Jina XLM-RoBERTa 文字編碼器(561M 參數、89 種語言、696,320 token 上下文)與 EVA02-L14 視覺編碼器(304M 參數、512×512 像素輸入)相結合。訓練採用多任務、多階段對比學習範式:模型同時在文字對、文字三元組和圖文對上訓練,以支援純文字和跨模態兩類任務。訓練資料集擴展了來自 29 種非英語語言(包括印地語、中文、德語、法語)的多語言文字,以及視覺豐富文件的圖片。Matryoshka 表示學習支援將向量維度從 1024 降到 64 維,同時保持 99% 以上的性能。模型使用 Last-Token-Pooling 作為最終向量。

效能

該模型在 Flickr30k 圖片到文字檢索上取得 98.0% 的準確率,超過 jina-clip-v1 和 NLLB-CLIP-SigLIP。在多語言場景中,跨語言圖片檢索相對於 NLLB-CLIP-SigLIP 最多提升 4%。向量壓縮效果顯著:維度降低 75%(1024→256)後,文字、圖片和跨模態任務上仍保持 99% 以上的性能。在 Multilingual MTEB 上,檢索取得 69.86%,語意相似度取得 67.77%,與專門的文字向量模型具有競爭力。89 種語言支援和視覺豐富文件處理使其特別適合全球電商和內容管理。

最佳實踐

處理前請將圖片調整為 512×512 像素——更大的圖片會自動分塊,增加 token 使用量和處理時間。該模型擅長在 89 種語言中匹配圖片與描述性文字,非常適合全球電商商品搜尋、內容推薦和多語言視覺搜尋。它可能在抽象概念或高度專業的領域內容上表現欠佳。使用 Matryoshka 降維時,64 維向量在索引上仍保持強勁性能;關鍵應用的重排序請使用 512 以上維度。該模型需要 CUDA 相容硬體。純文字工作負載請使用 jina-embeddings-v5-text-small(每參數精度更高)。程式碼檢索請使用 jina-code-embeddings-1.5b。可透過 Jina API、AWS、Azure 和 GCP 市場取得。

提及此模型的部落格