Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
向量模型
copyright CC BY-NC 4.0
open_in_new 发布博客

jina-clip-v2

文本和图片的多语言多模态向量模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2024-11-05
输入
image
图片
abc
文本
arrow_forward
输出
more_horiz
向量
Matryoshka 维度 help_outline
64
128
256
512
768
1024
模型详情
参数: 865M
输入词元长度: 8K
输入图像尺寸: 512×512
输出维度: 1024
底座模型 help_outline
open_in_new
EVA02-L-14
link
jina-embeddings-v3
已训练语言 help_outline
32 种语言
支持的语言 help_outline
108 种语言
相关模型
link
jina-clip-v1
可通过以下方式获取
Elastic Inference Service
Jina API
AWS SageMaker
微软云
谷歌云
Hugging Face
物理隔离
I/O 图 1

文本

jina-clip-v2

向量

I/O 图 2

图片

jina-clip-v2

向量

帕累托前沿help_outline
ViDoRe v1
CLIP Benchmark
CLIP Benchmark · t2i-recall@5
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
100M300M1B3.0B707580859095CLIP-ViT-g-14-laion2BCLIPA-v2 ViT-bigG/14-336DFN2B-CLIP-ViT-B-16DFN5B-CLIP-ViT-H-14-378EVA02-CLIP-E-14MetaCLIP ViT-H/14MetaCLIP ViT-L/14NLLB-CLIP-baseNLLB-CLIP-largenllb-siglip-basenllb-siglip-largeOpenAI CLIP RN101OpenAI CLIP RN50x4OpenAI CLIP ViT-L/14siglip-base-patch16-224siglip-base-patch16-512siglip-large-patch16-384siglip-so400m-patch14-3…jina-clip-v2参数量(对数)i2t-recall@5
本模型
在前沿上
Jina AI
其他
CLIP Benchmark
89.73
参数量
865M
按分数的排名
34 / 56
帕累托前沿
在前沿之后
取值分布help_outline
AUC 0.8383
语料
翻译对
文档检索
图片 / 头图
图片 / 标识
任务
default
retrieval.query
0.6040.000.200.400.60
相关20.2%
困难负例3.6%
无关0.8%
推荐阈值
FPR 0.1 · 0.508
FPR 0.01 · 0.604
FPR 0.001 · 0.668
FPR 0.0001 · 0.714
均衡 · 0.403
AUC
0.8383
噪声上限
0.666
召回悬崖
0.224
测量样本对
119 / 11k
向量分量help_outline
-0.43-0.070.29
σ 0.0313 · 244k 个数值
向量几何help_outline
01024
各维度均值,悬停查看区间
噪声下限
0.420
有效维度
52 / 1024
语言对help_outline
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.064
选择要比较的模型
论文 (2)
ICLR 2026
一月 22, 2026
Embedding Compression via Spherical Coordinates
ICLR 2025
十二月 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images

概述

jina-clip-v2 是一个 865M 参数的多语言多模态向量模型,支持 89 种语言和 512×512 图像输入。它在 jina-clip-v1 基础上增加了跨语言图文对齐、用于降维的 Matryoshka 表示学习(1024→64),以及在视觉丰富文档上的性能提升。它在跨语言图像检索上达到最先进水平,同时保持纯文本和单模态上的强劲表现。

方法

该模型采用双编码器架构,将 Jina XLM-RoBERTa 文本编码器(561M 参数、89 种语言、696,320 token 上下文)与 EVA02-L14 视觉编码器(304M 参数、512×512 像素输入)相结合。训练采用多任务、多阶段对比学习范式:模型同时在文本对、文本三元组和图文对上训练,以支持纯文本和跨模态两类任务。训练数据集扩展了来自 29 种非英语语言(包括印地语、中文、德语、法语)的多语言文本,以及视觉丰富文档的图像。Matryoshka 表示学习支持将向量维度从 1024 降到 64 维,同时保持 99% 以上的性能。模型使用 Last-Token-Pooling 作为最终向量。

性能

该模型在 Flickr30k 图像到文本检索上取得 98.0% 的准确率,超过 jina-clip-v1 和 NLLB-CLIP-SigLIP。在多语言场景中,跨语言图像检索相比 NLLB-CLIP-SigLIP 最多提升 4%。向量压缩效果显著:维度降低 75%(1024→256)后,文本、图像和跨模态任务上仍保持 99% 以上的性能。在 Multilingual MTEB 上,检索取得 69.86%,语义相似度取得 67.77%,与专门的文本向量模型具有竞争力。89 种语言支持和视觉丰富文档处理使其特别适合全球电商和内容管理。

最佳实践

处理前请将图像调整为 512×512 像素——更大的图像会自动分块,增加 token 使用量和处理时间。该模型擅长在 89 种语言中匹配图像与描述性文本,非常适合全球电商商品搜索、内容推荐和多语言视觉搜索。它可能在抽象概念或高度专业的领域内容上表现欠佳。使用 Matryoshka 降维时,64 维向量在索引上仍保持强劲性能;关键应用的重排序请使用 512 以上维度。该模型需要 CUDA 兼容硬件。纯文本工作负载请使用 jina-embeddings-v5-text-small(每参数精度更高)。代码检索请使用 jina-code-embeddings-1.5b。可通过 Jina API、AWS、Azure 和 GCP 市场获取。

提及此模型的博客
七月 31, 2025 • 12 分钟阅读
How Image Resolution Impacts Visual Document Retrieval
Image resolution is crucial for embedding visually rich documents. Too small and models miss key details; too large and they can't connect the parts.
Maximilian Werk
Michael Günther
Scott Martens
Abstract composition with a dark background featuring a flower-like design, radiant eye-like feature, rainbow-colored curved
七月 25, 2025 • 8 分钟阅读
JinaVDR: New Visual Document Retrieval Benchmark with 95 Tasks in 20 Languages
JinaVDR is a new benchmark spanning 95 tasks across 20 languages for visual document retrieval, soon on MTEB.
Maximilian Werk
Alex C-G
Black-and-white design for "Jinavor Benchmark" with bold text. Below, "Visual Docs: 95 Tasks: 20 Languages" appears; an abstr
六月 25, 2025 • 12 分钟阅读
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
五月 28, 2025 • 4 分钟阅读
Correlations: Vibe-Testing Embeddings in GUI
As serious as we are about MTEB, we also love vibe-testing. Correlations is a simple GUI we use for validating citations in DeepSearch, debugging late chunking, and vibe-testing embeddings. Now it's open-source.
Jina AI
Technical screen showing green and yellow visual data, including charts in the lower half and a heat-map-like visualization a
五月 25, 2025 • 21 分钟阅读
What We Learned at ICLR2025
We collect some most interesting papers in ICLR 2025, featuring TIPS, FlexPrefill, Zero-Shot Rerankers, SVD-LLM, Hymba etc.
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 标志
open_in_new
下载 Elastic 标志
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业使用,不面向消费者。