Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 许可证
open_in_new 发布博客

jina-clip-v1

图片和英文文本的多模态向量模型
许可证
Apache-2.0
发布日期
calendar_month
2024-06-05
输入
image
图片
abc
文本
arrow_forward
输出
more_horiz
向量
模型详情
参数: 223M
输入词元长度: 8K
输入图像尺寸: 224×224
输出维度: 768
底座模型 help_outline
open_in_new
EVA02-B-16
link
jina-embeddings-v2-base-en
已训练语言 help_outline
1 种语言
相关模型
link
jina-clip-v2
link
jina-embeddings-v3
link
jina-colbert-v2
可通过以下方式获取
Jina API
AWS SageMaker
微软云
Hugging Face
物理隔离
I/O 图 1

文本

jina-clip-v1

向量

I/O 图 2

图片

jina-clip-v1

向量

帕累托前沿 help_outline
workspace_premium
MTEB English
ViDoRe v1
MIEB
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
chevron_leftchevron_right
300M1B3.0B10B20406080100bge-visualized-m3BiModernVBERTDSE-Phi3dse-qwen2-2b-mrl-v1e5-vjina-clip-v2jina-embeddings-v3jina-embeddings-v4llama-nemoretriever-col…MoCa-3Bnemotron-colembed-vl-8b…nllb-siglip-largeONE-PEACESauerkrautLM-ColLFM2-45…SauerkrautLM-ColMinistr…siglip-so400m-patch14-3…SigLIP2-L-512/16VLM2VecVultronRetrieverFlash-Q…jina-clip-v1参数量(对数)nDCG@5
本模型
在前沿上
Jina AI
其他
ViDoRe v1
17.72
参数量
223M
按分数的排名
32 / 33
帕累托前沿
在前沿上
取值分布help_outline
AUC 0.8440
语料
翻译对
文档检索
图片 / 头图
0.6750.000.200.400.600.80
相关20.2%
困难负例3.2%
无关1.2%
推荐阈值
FPR 0.1 · 0.478
FPR 0.01 · 0.675
FPR 0.001 · 0.785
FPR 0.0001 · 0.823
均衡 · 0.376
AUC
0.8440
噪声上限
0.779
召回悬崖
0.123
测量样本对
119 / 11k
向量分量help_outline
-0.18-0.010.15
σ 0.0361 · 183k 个数值
向量几何help_outline
0768
各维度均值,悬停查看区间
噪声下限
0.283
有效维度
55 / 768
选择要比较的模型
论文 (1)
ICML 2024
五月 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever

概述

jina-clip-v1 是一个 223M 参数的多模态向量模型,在文本到文本和文本到图像检索任务上均达到最先进的性能——CLIP 家族模型中首次实现。与为跨模态对齐而牺牲纯文本检索的标准 CLIP 模型不同,jina-clip-v1 通过多任务对比训练在所有检索组合中保持强劲表现。它支持 12,288 token 的文本上下文,是原始 CLIP 77 token 限制的 100 倍。

方法

该架构将改造后的 Jina BERT v2 文本编码器(通过 ALiBi 支持 12,288 token)与北京智源人工智能研究院(Beijing Academy for AI)的 EVA-02 图像编码器相结合。关键创新是多任务对比训练方法:模型同时在 (1) 图像-字幕对上进行跨模态对齐、(2) 文本-文本对上保持纯文本检索质量、(3) AI 生成的图像长文本描述上提升对不同文本长度的鲁棒性进行训练。最后阶段使用困难负样本文本三元组来锐化语义区分。这种多任务方法防止了标准 CLIP 训练中常见的纯文本检索灾难性遗忘。图像编码器处理 224×224 像素块,每个块消耗 1,000 token 的处理容量。

性能

在纯文本检索中,该模型相比 OpenAI CLIP 性能提升 165%(MTEB 上 0.429 vs 0.162)。图像任务:文本到图像检索提升 2%(0.899)、图像到文本检索提升 6%(0.803)、图像到图像检索提升 12%(0.916)。在零样本视觉分类(CIFAR-100)上,优于标准 CLIP。在 Flickr8k/30k 和 MSCOCO Captions 上的跨模态性能与专门的单模态模型相当。12,288 token 的文本上下文对于连同图像检索长文档是重大优势。2026 年,jina-clip-v2 以 89 种语言支持和 512×512 图像处理取代该模型。

最佳实践

该模型以 224×224 像素块处理图像;每个块消耗 1,000 token。一张 750×500 像素的图像需要 12 个块(12,000 token)。文本约每词 1.1 token。请为混合模态查询相应规划 token 预算。该模型目前仅支持英语——多语言应用请使用 jina-clip-v2。可通过 Jina Embeddings API 使用,也可作为 Hugging Face 上 Apache 2.0 许可的开源版本。生产环境中,AWS Marketplace 和 Azure 部署选项提供优化的基础设施。跨模态比较请使用余弦相似度。新的多模态项目请优先选择 jina-clip-v2(89 种语言、512×512 图像、支持 MRL)或 jina-embeddings-v4(32K 上下文、多向量模式、支持代码)。

提及此模型的博客
六月 25, 2025 • 12 分钟阅读
Jina 向量模型 (Embeddings) v4:用于多模态多语言检索的通用向量模型 (Embeddings)
Jina 向量模型 (Embeddings) v4 是一个拥有 38 亿参数的通用向量模型 (embedding model),用于多模态和多语言检索,支持单向量和多向量向量模型 (embedding) 输出。
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
四月 08, 2025 • 21 分钟阅读
jina-reranker-m0:多语言多模态文档重排模型
介绍我们的新型多语言多模态重排序器 jina-reranker-m0,它专门用于视觉文档检索,在多语言长文档和代码搜索任务中达到了最先进的性能水平。
Jina AI
Modern dot matrix text display on a dark blue background, conveying a digital feel.
十二月 12, 2024 • 12 分钟阅读
嵌入模型的推理计算规模化
更好的结果会随着计算量的增加而提升——更多的学习,更多的搜索。一个好的预训练模型可以让你走得更远,但测试时的计算量可以让你走得更远。重要的是要认识到这种测试时计算量扩展的新范式,即使是对于 embedding 模型也是如此。
Han Xiao
David Hockney artwork of a hand holding a rod with three colored spheres on a blue-toned background.
十二月 04, 2024 • 13 分钟阅读
长文本模型已全能,我们还需要分块处理吗?
对比不同分块策略下长文本嵌入模型的表现,以找到最适合您需求的最佳方案。
Michael Günther
Alex C-G
Artistic pixel art of two seagulls on colored pipes with speech bubbles; one reads "Too long?" and the other shows math equat
十一月 21, 2024 • 9 分钟阅读
Jina CLIP v2:用于文本和图像的多语言多模态嵌入
Jina-CLIP v2,这是一个 0.9B 参数的多模态嵌入模型,支持 89 种语言的多语言处理,可处理 512x512 的高分辨率图像,并具有俄罗斯套娃式表征能力。
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 标志
open_in_new
下载 Elastic 标志
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业使用,不面向消费者。