概述
jina-clip-v2 是一个 865M 参数的多语言多模态向量模型,支持 89 种语言和 512×512 图像输入。它在 jina-clip-v1 基础上增加了跨语言图文对齐、用于降维的 Matryoshka 表示学习(1024→64),以及在视觉丰富文档上的性能提升。它在跨语言图像检索上达到最先进水平,同时保持纯文本和单模态上的强劲表现。
方法
该模型采用双编码器架构,将 Jina XLM-RoBERTa 文本编码器(561M 参数、89 种语言、696,320 token 上下文)与 EVA02-L14 视觉编码器(304M 参数、512×512 像素输入)相结合。训练采用多任务、多阶段对比学习范式:模型同时在文本对、文本三元组和图文对上训练,以支持纯文本和跨模态两类任务。训练数据集扩展了来自 29 种非英语语言(包括印地语、中文、德语、法语)的多语言文本,以及视觉丰富文档的图像。Matryoshka 表示学习支持将向量维度从 1024 降到 64 维,同时保持 99% 以上的性能。模型使用 Last-Token-Pooling 作为最终向量。
性能
该模型在 Flickr30k 图像到文本检索上取得 98.0% 的准确率,超过 jina-clip-v1 和 NLLB-CLIP-SigLIP。在多语言场景中,跨语言图像检索相比 NLLB-CLIP-SigLIP 最多提升 4%。向量压缩效果显著:维度降低 75%(1024→256)后,文本、图像和跨模态任务上仍保持 99% 以上的性能。在 Multilingual MTEB 上,检索取得 69.86%,语义相似度取得 67.77%,与专门的文本向量模型具有竞争力。89 种语言支持和视觉丰富文档处理使其特别适合全球电商和内容管理。
最佳实践
处理前请将图像调整为 512×512 像素——更大的图像会自动分块,增加 token 使用量和处理时间。该模型擅长在 89 种语言中匹配图像与描述性文本,非常适合全球电商商品搜索、内容推荐和多语言视觉搜索。它可能在抽象概念或高度专业的领域内容上表现欠佳。使用 Matryoshka 降维时,64 维向量在索引上仍保持强劲性能;关键应用的重排序请使用 512 以上维度。该模型需要 CUDA 兼容硬件。纯文本工作负载请使用 jina-embeddings-v5-text-small(每参数精度更高)。代码检索请使用 jina-code-embeddings-1.5b。可通过 Jina API、AWS、Azure 和 GCP 市场获取。











