I/O 图 1
I/O 图 2
帕累托前沿help_outline
chevron_leftchevron_right
本模型
在前沿上
Jina AI
其他
CLIP Benchmark
87.65
参数量
223M
按分数的排名
44 / 56
帕累托前沿
在前沿之后
取值分布help_outlineAUC 0.8440
语料
翻译对
文档检索
图像 / 头图
相关20.2%
困难负例3.2%
无关1.2%
推荐阈值
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
均衡 · 0.376
AUC
0.8440
噪声上限
0.779
召回悬崖
0.123
测量样本对
119 / 11k
向量分量help_outline
σ 0.0361 · 183k 个数值
嵌入几何help_outline
各维度均值,悬停查看区间
噪声下限
0.283
有效维度
55 / 768
选择要比较的模型
论文 (1)
概述
Jina CLIP v1 是首个在文本到文本与文本到图像检索任务上同样出色的模型,为多模态 AI 带来了突破。传统 CLIP 模型在纯文本场景下往往力不从心,而该模型在各类检索组合中均达到业界领先水平,参数量却只有紧凑的 223M。它解决了行业的一大痛点:不再需要为文本和图像分别准备模型,从而降低系统复杂度和计算开销。对于构建搜索系统、推荐引擎或内容分析工具的团队,Jina CLIP v1 提供了单一而高效的方案,能以极高的准确度同时处理文本与视觉内容。
方法
该模型的架构是多模态 AI 设计上的一次重要创新,把改造过的 Jina BERT v2 文本编码器与北京智源人工智能研究院前沿的 EVA-02 图像编码器结合在一起。文本编码器支持最长 12,288 词元的序列,是原始 CLIP 77 词元上限的 100 多倍;图像编码器则可高效处理 16 个图块词元。训练采用新颖的三步法:第一步对齐图文配对,同时穿插文本对训练以保持文本理解能力;第二步引入 AI 生成的更长图像描述;第三步用难负样本文本三元组强化语义辨别力。这套独特的训练方法让模型在短标题和详细文字描述上都能保持出色表现,同时保留强大的视觉理解能力。
性能
在所有基准测试中,Jina CLIP v1 都比 OpenAI 的原版 CLIP 有显著提升。纯文本检索得分 0.429,而 CLIP 为 0.162,提升达 165%。图像相关任务同样稳步提升:文本到图像检索提高 2%(0.899),图像到文本检索提高 6%(0.803),图像到图像检索提高 12%(0.916)。该模型在零样本视觉分类任务中尤为出色,无需针对特定领域预先训练即可准确归类图像。在文本检索的 MTEB、图像任务的 CIFAR-100,以及跨模态评测的 Flickr8k/30k 和 MSCOCO Captions 等标准基准上,它始终优于专用的单模态模型,跨模态任务的成绩也颇具竞争力。
最佳实践
要用好 Jina CLIP v1,团队需要同时权衡它的能力和资源开销。模型按 224x224 像素的图块处理图像,每个图块消耗 1,000 词元。为获得最佳性能,请在预处理阶段把图像尺寸调整到与之匹配。该模型在长短文本上都表现出色,但目前仅支持英语输入。词元用量也需仔细估算:文本约每个单词 1.1 词元,图像则按图块计算,例如一张 750x500 像素的图像需要 12 个图块,消耗 12,000 词元。模型既可通过 Jina Embeddings API 调用,也已在 Hugging Face 上以 Apache 2.0 协议开源,部署方式灵活。生产环境可考虑 AWS Marketplace 或 Azure 的部署方案,二者都提供了优化好的基础设施配置。
提及此模型的博客









