概述
jina-embeddings-v5-omni-small 是一个约 1.74B 参数的多模态向量模型,可接受文本、图像、视频、音频和 PDF,在共享的 1024 维向量空间中生成向量。它是 Jina API 的默认向量模型,在 Jina 的多模态向量模型中提供最佳的精度-效率权衡。纯文本输出与 jina-embeddings-v5-text-small 按位相同,无需重建索引即可从纯文本无缝迁移到多模态。
方法
该模型在扩展 jina-embeddings-v5-text-small 的第三阶段训练。多模态训练期间,Qwen3-0.6B-Base 文本骨干和全部四个任务特定 LoRA 适配器均被冻结,只有跨模态投影器是新训练的。SigLIP2 Large 视觉编码器处理图像和视频(每视频均匀采样 32 帧)。Whisper-large-v3 音频编码器处理音频输入。PDF 页面渲染为图像,经视觉通路处理。训练使用带跨模态困难负样本的对比损失,将视觉和音频表示与现有文本向量空间对齐。1024 维输出支持 Matryoshka 截断至 32 维。32K token 上下文窗口覆盖文本输入。该模型支持 Apple Silicon 的量化推理和 MLX 推理。
性能
纯文本性能与 jina-embeddings-v5-text-small(MMTEB 任务级平均 67.0,英文 MTEB 71.7)按位相同——多模态训练期间文本骨干和 LoRA 适配器未受改动。在跨模态检索中,该模型在文本-图像、文本-音频和文本-视频任务上表现出强对齐。PDF 页面检索经视觉通路处理。omni-small 模型为服务器部署在 Jina 多模态向量模型中提供最佳的精度-效率权衡,其 1024 维向量比 768 维的 omni-nano 变体具有更强的判别力。
最佳实践
选择合适的 LoRA 适配器:retrieval、text-matching、clustering 或 classification。对于经 API 的多模态输入,直接传递图像 URL、音频文件 URL、视频文件 URL 或 PDF URL——模型将每种模态路由到相应编码器。支持的音频格式包括 WAV、MP3、FLAC、OGG、M4A 和 Opus。视频输入按 32 帧均匀采样处理。可以在单个批次内自由混合模态:向量空间在所有模态间共享。使用余弦相似度进行比较。支持从 1024 到 32 维的 Matryoshka 截断。纯文本向量与 jina-embeddings-v5-text-small 即插即用兼容——升级时无需重建索引。对于无 GPU 的边缘部署,请改用 jina-embeddings-v5-omni-nano。



