I/O 图 1

文本

jina-clip-v2

向量

I/O 图 2

图片

jina-clip-v2

向量

帕累托前沿
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2参数量(对数)i2t-recall@5
本模型
在前沿上
Jina AI
其他
CLIP Benchmark
89.73
参数量
865M
按分数的排名
34 / 56
帕累托前沿
在前沿之后
取值分布
AUC 0.8383
语料
翻译对
文档检索
图片 / 头图
图片 / 标识
任务
default
retrieval.query
0.6040.000.200.400.60
相关20.2%
困难负例3.6%
无关0.8%
推荐阈值
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
均衡 · 0.403
AUC
0.8383
噪声上限
0.666
召回悬崖
0.224
测量样本对
119 / 11k
向量分量
-0.43-0.070.29
σ 0.0313 · 244k 个数值
向量几何
01024
各维度均值,悬停查看区间
噪声下限
0.420
有效维度
52 / 1024
语言对
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.064
选择要比较的模型
论文 (2)

概述

jina-clip-v2 是一个 865M 参数的多语言多模态向量模型,支持 89 种语言和 512×512 图像输入。它在 jina-clip-v1 基础上增加了跨语言图文对齐、用于降维的 Matryoshka 表示学习(1024→64),以及在视觉丰富文档上的性能提升。它在跨语言图像检索上达到最先进水平,同时保持纯文本和单模态上的强劲表现。

方法

该模型采用双编码器架构,将 Jina XLM-RoBERTa 文本编码器(561M 参数、89 种语言、696,320 token 上下文)与 EVA02-L14 视觉编码器(304M 参数、512×512 像素输入)相结合。训练采用多任务、多阶段对比学习范式:模型同时在文本对、文本三元组和图文对上训练,以支持纯文本和跨模态两类任务。训练数据集扩展了来自 29 种非英语语言(包括印地语、中文、德语、法语)的多语言文本,以及视觉丰富文档的图像。Matryoshka 表示学习支持将向量维度从 1024 降到 64 维,同时保持 99% 以上的性能。模型使用 Last-Token-Pooling 作为最终向量。

性能

该模型在 Flickr30k 图像到文本检索上取得 98.0% 的准确率,超过 jina-clip-v1 和 NLLB-CLIP-SigLIP。在多语言场景中,跨语言图像检索相比 NLLB-CLIP-SigLIP 最多提升 4%。向量压缩效果显著:维度降低 75%(1024→256)后,文本、图像和跨模态任务上仍保持 99% 以上的性能。在 Multilingual MTEB 上,检索取得 69.86%,语义相似度取得 67.77%,与专门的文本向量模型具有竞争力。89 种语言支持和视觉丰富文档处理使其特别适合全球电商和内容管理。

最佳实践

处理前请将图像调整为 512×512 像素——更大的图像会自动分块,增加 token 使用量和处理时间。该模型擅长在 89 种语言中匹配图像与描述性文本,非常适合全球电商商品搜索、内容推荐和多语言视觉搜索。它可能在抽象概念或高度专业的领域内容上表现欠佳。使用 Matryoshka 降维时,64 维向量在索引上仍保持强劲性能;关键应用的重排序请使用 512 以上维度。该模型需要 CUDA 兼容硬件。纯文本工作负载请使用 jina-embeddings-v5-text-small(每参数精度更高)。代码检索请使用 jina-code-embeddings-1.5b。可通过 Jina API、AWS、Azure 和 GCP 市场获取。

提及此模型的博客