I/O 图 1
I/O 图 2
取值分布help_outlineAUC 0.8383
语料
翻译对
文档检索
图像 / 头图
图像 / 标识
任务
default
retrieval.query
相关20.2%
困难负例3.6%
无关0.8%
悬停或点击图表可移动阈值
推荐阈值
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
均衡 · 0.403
AUC
0.8383
噪声上限
0.666
召回悬崖
0.224
测量样本对
119 / 11k
向量分量help_outline
σ 0.0313 · 244k 个数值
嵌入几何help_outline
各维度均值,悬停查看区间
噪声下限
0.420
有效维度
52 / 1024
语言对help_outline
各语言对之间的阈值跨度:0.064
选择要比较的模型
论文 (2)
概述
Jina CLIP v2 打通视觉与文本理解,覆盖 89 种语言,为多模态 AI 带来全新可能。它让图文匹配不再受语言障碍限制,切实解决了全球电商、内容管理和跨文化沟通中的核心难题。对于拓展海外市场或管理多语言内容的企业,无需再为每种语言单独部署模型,也不必搭建复杂的翻译流程。在需要跨语言精准视觉搜索的场景中,例如全球电商平台的商品发现或多语言数字资产管理,该模型的表现尤为突出。
方法
Jina CLIP v2 的核心是一套精巧的双编码器架构,把 Jina XLM-RoBERTa 文本编码器(5.61 亿参数)与 EVA02-L14 视觉编码器(3.04 亿参数)结合在一起。文本编码器以 696,320 词元的超大上下文窗口处理 89 种语言的内容,视觉编码器则可处理最高 512x512 像素的高分辨率图像。该模型引入了创新的 Matryoshka 表示学习,向量维度可从 1024 动态调整到 64,性能基本不受影响。文本和图像分别经各自的编码器处理后,被投射到同一个语义空间,含义相近的概念无论来自哪种模态或语言都会彼此靠拢。
性能
该模型在 Flickr30k 图像到文本检索任务中取得 98.0% 的准确率,达到业界领先水平,超过上一代和 NLLB-CLIP-SigLIP。多语言场景下,尽管参数量少于最大的竞品,它在跨语言图像检索任务上仍比 NLLB-CLIP-SigLIP 高出最多 4%。即便压缩向量,模型表现依然稳健:维度减少 75% 后,文本、图像和跨模态任务仍能保留 99% 以上的性能。在综合性的多语言 MTEB 基准上,检索任务得 69.86%,语义相似度任务得 67.77%,与专用文本向量模型不相上下。
最佳实践
要获得最佳部署效果,请留意以下几个关键点。模型需要支持 CUDA 的硬件才能高效运行,显存需求随批大小和图像分辨率变化。为控制 API 成本和耗时,建议先把图像缩放到 512x512 像素再处理,更大的图像会被自动切分成图块,词元用量和处理时间都会增加。该模型擅长跨语言匹配图像与描述文本,但面对抽象概念或高度专业的垂直领域内容可能力有不逮。它非常适合电商商品搜索、内容推荐和视觉搜索场景,但不太适合需要细粒度视觉细节分析或深度专业知识的任务。使用 Matryoshka 表示时,请权衡降维与性能:64 维向量仍能保持不错的效果,但关键业务建议采用更高维度。
提及此模型的博客












