I/O 图 1
I/O 图 2
I/O 图 3
I/O 图 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
取值分布help_outlineAUC 0.8269
语料
翻译对
文档检索
代码
图像 / 头图
图像 / 标识
任务
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
相关10.9%
困难负例2.1%
无关0.9%
推荐阈值
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
均衡 · 0.697
AUC
0.8269
噪声上限
0.855
召回悬崖
0.566
测量样本对
119 / 11k
该模型与 jina-embeddings-v5-text-small 共用文本塔。此处的分布即为该模型的分布,二者在 fp16 传输精度下一致。
向量分量help_outline
σ 0.0313 · 244k 个数值
嵌入几何help_outline
各维度均值,悬停查看区间
噪声下限
0.300
有效维度
70 / 1024
维度截断help_outline
text-matching · 阈值随所请求维度的变化
语言对help_outline
各语言对之间的阈值跨度:0.024
选择要比较的模型
论文 (1)
概述
jina-embeddings-v5-omni-small(约 17.4 亿参数)是一款多模态向量模型,可接收文本、图像、视频和音频,并在与 jina-embeddings-v5-text-small 对齐的共享向量空间中输出向量。您可以用文本建索引、用任意模态查询,反之亦然,无需重建索引。多模态训练期间,文本主干网络和四个面向特定任务的 LoRA 适配器(检索、文本匹配、聚类、分类)全部冻结,因此纯文本输出与 jina-embeddings-v5-text-small 逐位一致。模型输出 1024 维向量,可通过 Matryoshka 截断至最低 32 维,支持 32K 词元的上下文长度。
方法
在 jina-embeddings-v5-text-small 之上增加第三阶段训练。文本主干网络和四个面向特定任务的 LoRA 适配器全部冻结,只训练新增的跨模态投影器。图像和视频(均匀采样 32 帧)由 SigLIP2 So400m 视觉编码器处理,音频输入由 Whisper-large-v3 音频编码器处理,PDF 页面则渲染成图像后走视觉通路。训练采用带跨模态难负样本的对比损失,把视觉和音频表示对齐到已有的文本向量空间。
性能
纯文本性能与 jina-embeddings-v5-text-small 逐位一致,多模态训练期间文本主干网络和 LoRA 适配器均未改动。跨模态检索方面,模型在文本-图像、文本-音频和文本-视频任务上都展现出良好的对齐效果,PDF 页面检索则走视觉通路完成。在 Jina 的多模态向量模型中,omni-small 在服务器部署场景下的精度与效率平衡最佳。
最佳实践
适配器与 v5-text-small 相同,仍是检索、文本匹配、聚类、分类四个。通过 API 传入多模态输入时,直接传图像 URL、音频文件 URL、视频文件 URL 或 PDF URL 即可,模型会把各模态分派给对应的编码器。支持的音频格式包括 WAV、MP3、FLAC、OGG、M4A 和 Opus。视频输入按均匀采样的 32 帧处理。同一批次内可自由混合不同模态,因为所有模态共享同一向量空间。比对请使用余弦相似度。支持从 1024 维到 32 维的 Matryoshka 截断。纯文本向量与 jina-embeddings-v5-text-small 完全兼容,升级时无需重建索引。
提及此模型的博客



