I/O 圖 1
I/O 圖 2
帕累託前緣help_outline
chevron_leftchevron_right
本模型
在前緣上
Jina AI
其他
CLIP Benchmark
87.65
參數量
223M
按分數的排名
44 / 56
帕累託前緣
在前緣之後
取值分佈help_outlineAUC 0.8440
語料
翻譯對
文件檢索
影像 / 頭圖
相關20.2%
困難負例3.2%
無關1.2%
推薦閾值
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
均衡 · 0.376
AUC
0.8440
噪聲上限
0.779
召回懸崖
0.123
測量樣本對
119 / 11k
向量分量help_outline
σ 0.0361 · 183k 個數值
嵌入幾何help_outline
各維度均值,懸停檢視區間
噪聲下限
0.283
有效維度
55 / 768
選擇要比較的模型
論文 (1)
概述
Jina CLIP v1 是首個在文字到文字與文字到影像檢索任務上同樣出色的模型,為多模態 AI 帶來了突破。傳統 CLIP 模型在純文字場景下往往力不從心,而該模型在各類檢索組合中均達到業界領先水平,參數量卻只有緊湊的 223M。它解決了行業的一大痛點:不再需要為文字和影像分別準備模型,從而降低系統複雜度和計算開銷。對於構建搜尋系統、推薦引擎或內容分析工具的團隊,Jina CLIP v1 提供了單一而高效的方案,能以極高的準確度同時處理文字與視覺內容。
方法
該模型的架構是多模態 AI 設計上的一次重要創新,把改造過的 Jina BERT v2 文字編碼器與北京智源人工智慧研究院前沿的 EVA-02 影像編碼器結合在一起。文字編碼器支援最長 12,288 詞元的序列,是原始 CLIP 77 詞元上限的 100 多倍;影像編碼器則可高效處理 16 個圖塊詞元。訓練採用新穎的三步法:第一步對齊圖文配對,同時穿插文字對訓練以保持文字理解能力;第二步引入 AI 生成的更長影像描述;第三步用難負樣本文字三元組強化語義辨別力。這套獨特的訓練方法讓模型在短標題和詳細文字描述上都能保持出色表現,同時保留強大的視覺理解能力。
效能
在所有基準測試中,Jina CLIP v1 都比 OpenAI 的原版 CLIP 有顯著提升。純文字檢索得分 0.429,而 CLIP 為 0.162,提升達 165%。影像相關任務同樣穩步提升:文字到影像檢索提高 2%(0.899),影像到文字檢索提高 6%(0.803),影像到影像檢索提高 12%(0.916)。該模型在零樣本視覺分類任務中尤為出色,無需針對特定領域預先訓練即可準確歸類影像。在文字檢索的 MTEB、影像任務的 CIFAR-100,以及跨模態評測的 Flickr8k/30k 和 MSCOCO Captions 等標準基準上,它始終優於專用的單模態模型,跨模態任務的成績也頗具競爭力。
最佳實踐
要用好 Jina CLIP v1,團隊需要同時權衡它的能力和資源開銷。模型按 224x224 畫素的圖塊處理影像,每個圖塊消耗 1,000 詞元。為獲得最佳效能,請在預處理階段把影像尺寸調整到與之匹配。該模型在長短文字上都表現出色,但目前僅支援英語輸入。詞元用量也需仔細估算:文字約每個單詞 1.1 詞元,影像則按圖塊計算,例如一張 750x500 畫素的影像需要 12 個圖塊,消耗 12,000 詞元。模型既可透過 Jina Embeddings API 呼叫,也已在 Hugging Face 上以 Apache 2.0 協議開源,部署方式靈活。生產環境可考慮 AWS Marketplace 或 Azure 的部署方案,二者都提供了最佳化好的基礎設施配置。
提及此模型的部落格









