Elastic
Jina AI
新闻
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP terminal命令行articlellms.txtsmart_toy智能体data_objectSchemamenu_book文档



登录
login
向量模型
copyright CC BY-NC 4.0
open_in_new 发布博客

jina-clip-v2

文本和图片的多语言多模态向量模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2024-11-05
输入
image
图像
abc
文本
arrow_forward
输出
more_horiz
向量
俄罗斯套娃维度 help_outline
64
128
256
512
768
1024
模型详情
参数: 865M
输入词元长度: 8K
输入图像尺寸: 512×512
输出维度: 1024
底座模型 help_outline
open_in_new
XLM-RoBERTa Large
已训练语言 help_outline
32 种语言
支持的语言 help_outline
108 种语言
相关模型
link
jina-clip-v1
可通过以下方式获取
Elastic Inference Service
Jina API
AWS SageMaker
微软云
谷歌云
Hugging Face
物理隔离
I/O 图 1

文本

jina-clip-v2

向量

I/O 图 2

图像

jina-clip-v2

向量

取值分布help_outline
AUC 0.8383
语料
翻译对
文档检索
图像 / 头图
图像 / 标识
任务
default
retrieval.query
0.6040.000.200.400.60
相关20.2%
困难负例3.6%
无关0.8%
悬停或点击图表可移动阈值
推荐阈值
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
均衡 · 0.403
AUC
0.8383
噪声上限
0.666
召回悬崖
0.224
测量样本对
119 / 11k
向量分量help_outline
-0.43-0.070.29
σ 0.0313 · 244k 个数值
嵌入几何help_outline
01024
各维度均值,悬停查看区间
噪声下限
0.420
有效维度
52 / 1024
语言对help_outline
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.064
选择要比较的模型
论文 (2)
ICLR 2026
一月 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
十二月 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

概述

Jina CLIP v2 打通视觉与文本理解,覆盖 89 种语言,为多模态 AI 带来全新可能。它让图文匹配不再受语言障碍限制,切实解决了全球电商、内容管理和跨文化沟通中的核心难题。对于拓展海外市场或管理多语言内容的企业,无需再为每种语言单独部署模型,也不必搭建复杂的翻译流程。在需要跨语言精准视觉搜索的场景中,例如全球电商平台的商品发现或多语言数字资产管理,该模型的表现尤为突出。

方法

Jina CLIP v2 的核心是一套精巧的双编码器架构,把 Jina XLM-RoBERTa 文本编码器(5.61 亿参数)与 EVA02-L14 视觉编码器(3.04 亿参数)结合在一起。文本编码器以 696,320 词元的超大上下文窗口处理 89 种语言的内容,视觉编码器则可处理最高 512x512 像素的高分辨率图像。该模型引入了创新的 Matryoshka 表示学习,向量维度可从 1024 动态调整到 64,性能基本不受影响。文本和图像分别经各自的编码器处理后,被投射到同一个语义空间,含义相近的概念无论来自哪种模态或语言都会彼此靠拢。

性能

该模型在 Flickr30k 图像到文本检索任务中取得 98.0% 的准确率,达到业界领先水平,超过上一代和 NLLB-CLIP-SigLIP。多语言场景下,尽管参数量少于最大的竞品,它在跨语言图像检索任务上仍比 NLLB-CLIP-SigLIP 高出最多 4%。即便压缩向量,模型表现依然稳健:维度减少 75% 后,文本、图像和跨模态任务仍能保留 99% 以上的性能。在综合性的多语言 MTEB 基准上,检索任务得 69.86%,语义相似度任务得 67.77%,与专用文本向量模型不相上下。

最佳实践

要获得最佳部署效果,请留意以下几个关键点。模型需要支持 CUDA 的硬件才能高效运行,显存需求随批大小和图像分辨率变化。为控制 API 成本和耗时,建议先把图像缩放到 512x512 像素再处理,更大的图像会被自动切分成图块,词元用量和处理时间都会增加。该模型擅长跨语言匹配图像与描述文本,但面对抽象概念或高度专业的垂直领域内容可能力有不逮。它非常适合电商商品搜索、内容推荐和视觉搜索场景,但不太适合需要细粒度视觉细节分析或深度专业知识的任务。使用 Matryoshka 表示时,请权衡降维与性能:64 维向量仍能保持不错的效果,但关键业务建议采用更高维度。
提及此模型的博客
十一月 21, 2024 • 9 分钟阅读
Jina CLIP v2:用于文本和图像的多语言多模态嵌入
Jina-CLIP v2,这是一个 0.9B 参数的多模态嵌入模型,支持 89 种语言的多语言处理,可处理 512x512 的高分辨率图像,并具有俄罗斯套娃式表征能力。
Jina AI
Digital number "2" displayed in a mosaic of colorful squares against a dark background, creating a futuristic vibe.
十月 29, 2024 • 11 分钟阅读
超越 CLIP:Jina-CLIP 如何推进多模态搜索技术
了解 Jina-CLIP 如何通过统一的文本-图像嵌入向量来增强 OpenAI 的 CLIP,实现更高的检索精度和更多样化的结果。
Bo Wang
Alex C-G
Abstract digital landscape with wave-like green and pink dunes against a dark background, conveying a tranquil atmosphere.
六月 05, 2024 • 9 分钟阅读
Jina CLIP v1:真正用于文本和图像的多模态 Embeddings 模型
Jina AI 新推出的多模态嵌入模型不仅在文本-图像检索方面超越了 OpenAI CLIP,同时还是一个优秀的图像嵌入模型和领先的文本嵌入模型。您不再需要为不同的模态使用不同的模型了。
Sofia Vasileva
Scott Martens
Susana Guzmán
Abstract 3D render of a neon blue and green grid pattern on a black background, creating a sense of depth.
九月 27, 2024 • 15 分钟阅读
从 Jina Embeddings v2 迁移到 v3
我们收集了一些帮助你从 Jina Embeddings v2 迁移到 v3 的提示。
Alex C-G
Scott Martens
A digital upgrade theme with "V3" and a white "2", set against a green and black binary code background, with "Upgrade" centr
八月 30, 2024 • 10 分钟阅读
Jina ColBERT v2:用于向量检索和重排序的多语言后期交互检索器
Jina ColBERT v2 支持 89 种语言,具有卓越的检索性能、用户可控的输出维度以及 8192 的 token 长度。
Jina AI
Dark-themed coding interface displaying English and Japanese characters with "JINA COLBERT V2" highlighted in the center.
搜索底座
Reader
向量模型
重排模型
Elastic Inference Service
open_in_new
获取 Jina API 密钥
速率限制
API 状态
条款
安全
条款及条件
隐私
管理 Cookie
请勿出售或分享我的个人信息
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
Elastic © 2020-2026.
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。