Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 许可证
open_in_new 发布博客

jina-clip-v1

图片和英文文本的多模态向量模型
许可证
Apache-2.0
发布日期
calendar_month
2024-06-05
输入
image
图像
abc
文本
arrow_forward
输出
more_horiz
向量
模型详情
参数: 223M
输入词元长度: 8K
输入图像尺寸: 224×224
输出维度: 768
底座模型 help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
已训练语言 help_outline
1 种语言
相关模型
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
可通过以下方式获取
Jina API
AWS SageMaker
微软云
Hugging Face
物理隔离
I/O 图 1

文本

jina-clip-v1

向量

I/O 图 2

图像

jina-clip-v1

向量

帕累托前沿help_outline
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14jina-clip-v2MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v1参数量(对数)i2t-recall@5
本模型
在前沿上
Jina AI
其他
CLIP Benchmark
87.65
参数量
223M
按分数的排名
44 / 56
帕累托前沿
在前沿之后
取值分布help_outline
AUC 0.8440
语料
翻译对
文档检索
图像 / 头图
0.6750.000.200.400.600.80
相关20.2%
困难负例3.2%
无关1.2%
推荐阈值
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
均衡 · 0.376
AUC
0.8440
噪声上限
0.779
召回悬崖
0.123
测量样本对
119 / 11k
向量分量help_outline
-0.18-0.010.15
σ 0.0361 · 183k 个数值
嵌入几何help_outline
0768
各维度均值,悬停查看区间
噪声下限
0.283
有效维度
55 / 768
选择要比较的模型
论文 (1)
ICML 2024
五月 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

概述

Jina CLIP v1 是首个在文本到文本与文本到图像检索任务上同样出色的模型,为多模态 AI 带来了突破。传统 CLIP 模型在纯文本场景下往往力不从心,而该模型在各类检索组合中均达到业界领先水平,参数量却只有紧凑的 223M。它解决了行业的一大痛点:不再需要为文本和图像分别准备模型,从而降低系统复杂度和计算开销。对于构建搜索系统、推荐引擎或内容分析工具的团队,Jina CLIP v1 提供了单一而高效的方案,能以极高的准确度同时处理文本与视觉内容。

方法

该模型的架构是多模态 AI 设计上的一次重要创新,把改造过的 Jina BERT v2 文本编码器与北京智源人工智能研究院前沿的 EVA-02 图像编码器结合在一起。文本编码器支持最长 12,288 词元的序列,是原始 CLIP 77 词元上限的 100 多倍;图像编码器则可高效处理 16 个图块词元。训练采用新颖的三步法:第一步对齐图文配对,同时穿插文本对训练以保持文本理解能力;第二步引入 AI 生成的更长图像描述;第三步用难负样本文本三元组强化语义辨别力。这套独特的训练方法让模型在短标题和详细文字描述上都能保持出色表现,同时保留强大的视觉理解能力。

性能

在所有基准测试中,Jina CLIP v1 都比 OpenAI 的原版 CLIP 有显著提升。纯文本检索得分 0.429,而 CLIP 为 0.162,提升达 165%。图像相关任务同样稳步提升:文本到图像检索提高 2%(0.899),图像到文本检索提高 6%(0.803),图像到图像检索提高 12%(0.916)。该模型在零样本视觉分类任务中尤为出色,无需针对特定领域预先训练即可准确归类图像。在文本检索的 MTEB、图像任务的 CIFAR-100,以及跨模态评测的 Flickr8k/30k 和 MSCOCO Captions 等标准基准上,它始终优于专用的单模态模型,跨模态任务的成绩也颇具竞争力。

最佳实践

要用好 Jina CLIP v1,团队需要同时权衡它的能力和资源开销。模型按 224x224 像素的图块处理图像,每个图块消耗 1,000 词元。为获得最佳性能,请在预处理阶段把图像尺寸调整到与之匹配。该模型在长短文本上都表现出色,但目前仅支持英语输入。词元用量也需仔细估算:文本约每个单词 1.1 词元,图像则按图块计算,例如一张 750x500 像素的图像需要 12 个图块,消耗 12,000 词元。模型既可通过 Jina Embeddings API 调用,也已在 Hugging Face 上以 Apache 2.0 协议开源,部署方式灵活。生产环境可考虑 AWS Marketplace 或 Azure 的部署方案,二者都提供了优化好的基础设施配置。
提及此模型的博客
六月 25, 2025 • 12 分钟阅读
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
四月 08, 2025 • 21 分钟阅读
jina-reranker-m0: Multilingual Multimodal Document Reranker
Introducing jina-reranker-m0, our new multilingual multimodal reranker for retrieving visual documents, with SOTA performance on multilingual long documents and code searching tasks.
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
十二月 12, 2024 • 12 分钟阅读
Scaling Test-Time Compute For Embedding Models
Better results scale with compute—more on learning, more on search. A good pretrained model takes you far, but test-time compute takes you further. It's time to recognize this paradigm of test-time compute, even for embedding models.
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
十二月 04, 2024 • 13 分钟阅读
Still Need Chunking When Long-Context Models Can Do It All?
Comparing how long-context embedding models perform with different chunking strategies to find the optimal approach for your needs.
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
十一月 21, 2024 • 9 分钟阅读
Jina CLIP v2: Multilingual Multimodal Embeddings for Text and Images
Jina-CLIP v2, a 0.9B multimodal embedding model with multilingual support of 89 languages, high image resolution at 512x512, and Matryoshka representations.
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。