概述
jina-clip-v2 是一個 865M 參數的多語言多模態向量模型,支援 89 種語言和 512×512 圖片輸入。它在 jina-clip-v1 基礎上增加了跨語言圖文對齊、用於降維的 Matryoshka 表示學習(1024→64),以及在視覺豐富文件上的性能提升。它在跨語言圖片檢索上達到最先進水平,同時保持純文字和單模態上的強勁表現。
方法
該模型採用雙編碼器架構,將 Jina XLM-RoBERTa 文字編碼器(561M 參數、89 種語言、696,320 token 上下文)與 EVA02-L14 視覺編碼器(304M 參數、512×512 像素輸入)相結合。訓練採用多任務、多階段對比學習範式:模型同時在文字對、文字三元組和圖文對上訓練,以支援純文字和跨模態兩類任務。訓練資料集擴展了來自 29 種非英語語言(包括印地語、中文、德語、法語)的多語言文字,以及視覺豐富文件的圖片。Matryoshka 表示學習支援將向量維度從 1024 降到 64 維,同時保持 99% 以上的性能。模型使用 Last-Token-Pooling 作為最終向量。
效能
該模型在 Flickr30k 圖片到文字檢索上取得 98.0% 的準確率,超過 jina-clip-v1 和 NLLB-CLIP-SigLIP。在多語言場景中,跨語言圖片檢索相對於 NLLB-CLIP-SigLIP 最多提升 4%。向量壓縮效果顯著:維度降低 75%(1024→256)後,文字、圖片和跨模態任務上仍保持 99% 以上的性能。在 Multilingual MTEB 上,檢索取得 69.86%,語意相似度取得 67.77%,與專門的文字向量模型具有競爭力。89 種語言支援和視覺豐富文件處理使其特別適合全球電商和內容管理。
最佳實踐
處理前請將圖片調整為 512×512 像素——更大的圖片會自動分塊,增加 token 使用量和處理時間。該模型擅長在 89 種語言中匹配圖片與描述性文字,非常適合全球電商商品搜尋、內容推薦和多語言視覺搜尋。它可能在抽象概念或高度專業的領域內容上表現欠佳。使用 Matryoshka 降維時,64 維向量在索引上仍保持強勁性能;關鍵應用的重排序請使用 512 以上維度。該模型需要 CUDA 相容硬體。純文字工作負載請使用 jina-embeddings-v5-text-small(每參數精度更高)。程式碼檢索請使用 jina-code-embeddings-1.5b。可透過 Jina API、AWS、Azure 和 GCP 市場取得。











