概述
jina-clip-v1 是一個 223M 參數的多模態向量模型,在文字到文字和文字到圖片檢索任務上均達到最先進的性能——CLIP 家族模型中首次實現。與為跨模態對齊而犧牲純文字檢索的標準 CLIP 模型不同,jina-clip-v1 透過多任務對比訓練在所有檢索組合中保持強勁表現。它支援 12,288 token 的文字上下文,是原始 CLIP 77 token 限制的 100 倍。
方法
該架構將改造後的 Jina BERT v2 文字編碼器(透過 ALiBi 支援 12,288 token)與北京智源人工智慧研究院(Beijing Academy for AI)的 EVA-02 圖像編碼器相結合。關鍵創新是多任務對比訓練方法:模型同時在 (1) 圖片-字幕對上進行跨模態對齊、(2) 文字-文字對上保持純文字檢索品質、(3) AI 生成的圖片長文字描述上提升對不同文字長度的穩健性進行訓練。最後階段使用困難負樣本文字三元組來銳化語義區分。這種多任務方法防止了標準 CLIP 訓練中常見的純文字檢索災難性遺忘。圖像編碼器處理 224×224 像素塊,每個塊消耗 1,000 token 的處理容量。
效能
在純文字檢索中,該模型相對於 OpenAI CLIP 性能提升 165%(MTEB 上 0.429 vs 0.162)。圖片任務:文字到圖片檢索提升 2%(0.899)、圖片到文字檢索提升 6%(0.803)、圖片到圖片檢索提升 12%(0.916)。在零樣本視覺分類(CIFAR-100)上,優於標準 CLIP。在 Flickr8k/30k 和 MSCOCO Captions 上的跨模態性能與專門的單模態模型相當。12,288 token 的文字上下文對於連同圖片檢索長文件是重大優勢。2026 年,jina-clip-v2 以 89 種語言支援和 512×512 圖片處理取代該模型。
最佳實踐
該模型以 224×224 像素塊處理圖片;每個塊消耗 1,000 token。一張 750×500 像素的圖片需要 12 個塊(12,000 token)。文字約每詞 1.1 token。請為混合模態查詢相應規劃 token 預算。該模型目前僅支援英語——多語言應用請使用 jina-clip-v2。可透過 Jina Embeddings API 使用,也可作為 Hugging Face 上 Apache 2.0 許可的開源版本。生產環境中,AWS Marketplace 和 Azure 部署選項提供優化的基礎設施。跨模態比較請使用餘弦相似度。新的多模態專案請優先選擇 jina-clip-v2(89 種語言、512×512 圖片、支援 MRL)或 jina-embeddings-v4(32K 上下文、多向量模式、支援程式碼)。









