Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
向量模型
copyright CC BY-NC 4.0
open_in_new 发布博客

jina-embeddings-v5-omni-small

支持文本、图片、音频、视频和 PDF 的多模态向量模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2026-05-07
输入
abc
文本
image
图片
audiotrack
音频
videocam
视频
picture_as_pdf
PDF
arrow_forward
输出
more_horiz
向量
Matryoshka 维度 help_outline
32
64
128
256
512
768
1024
模型详情
参数: 1.7B
输入词元长度: 32K
输出维度: 1024
底座模型 help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
已训练语言 help_outline
32 种语言
支持的语言 help_outline
93 种语言
量化 help_outline
GGUF
苹果芯片支持 help_outline
MLX
相关模型
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
支持的任务
search 检索
compare_arrows 文本匹配
bubble_chart 聚类
label 分类
可通过以下方式获取
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
物理隔离
I/O 图 1

文本

jina-embeddings-v5-omni-small

图片

任务

向量

I/O 图 2

文本

jina-embeddings-v5-omni-small

音频

任务

向量

I/O 图 3

文本

jina-embeddings-v5-omni-small

视频

任务

向量

I/O 图 4

多个

向量

文本

jina-embeddings-v5-omni-small

PDF

任务

帕累托前沿help_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…参数量(对数)score
本模型
在前沿上
Jina AI
其他
MAEB
49.96
参数量
1.6B
按分数的排名
5 / 21
帕累托前沿
在前沿上
取值分布help_outline
AUC 0.8269
语料
翻译对
文档检索
代码
图片 / 头图
图片 / 标识
任务
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
相关10.9%
困难负例2.1%
无关0.9%
推荐阈值
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
均衡 · 0.697
AUC
0.8269
噪声上限
0.855
召回悬崖
0.566
测量样本对
119 / 11k
该模型与 jina-embeddings-v5-text-small 共用文本塔。此处的分布即为该模型的分布,二者在 fp16 传输精度下一致。
向量分量help_outline
-0.160.010.18
σ 0.0313 · 244k 个数值
向量几何help_outline
01024
各维度均值,悬停查看区间
噪声下限
0.300
有效维度
70 / 1024
维度截断help_outline
32641282565121024
text-matching · 阈值随所请求维度的变化
语言对help_outline
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.024
选择要比较的模型
论文 (1)
SIGIR 2026
五月 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

概述

jina-embeddings-v5-omni-small 是一个约 1.74B 参数的多模态向量模型,可接受文本、图像、视频、音频和 PDF,在共享的 1024 维向量空间中生成向量。它是 Jina API 的默认向量模型,在 Jina 的多模态向量模型中提供最佳的精度-效率权衡。纯文本输出与 jina-embeddings-v5-text-small 按位相同,无需重建索引即可从纯文本无缝迁移到多模态。

方法

该模型在扩展 jina-embeddings-v5-text-small 的第三阶段训练。多模态训练期间,Qwen3-0.6B-Base 文本骨干和全部四个任务特定 LoRA 适配器均被冻结,只有跨模态投影器是新训练的。SigLIP2 Large 视觉编码器处理图像和视频(每视频均匀采样 32 帧)。Whisper-large-v3 音频编码器处理音频输入。PDF 页面渲染为图像,经视觉通路处理。训练使用带跨模态困难负样本的对比损失,将视觉和音频表示与现有文本向量空间对齐。1024 维输出支持 Matryoshka 截断至 32 维。32K token 上下文窗口覆盖文本输入。该模型支持 Apple Silicon 的量化推理和 MLX 推理。

性能

纯文本性能与 jina-embeddings-v5-text-small(MMTEB 任务级平均 67.0,英文 MTEB 71.7)按位相同——多模态训练期间文本骨干和 LoRA 适配器未受改动。在跨模态检索中,该模型在文本-图像、文本-音频和文本-视频任务上表现出强对齐。PDF 页面检索经视觉通路处理。omni-small 模型为服务器部署在 Jina 多模态向量模型中提供最佳的精度-效率权衡,其 1024 维向量比 768 维的 omni-nano 变体具有更强的判别力。

最佳实践

选择合适的 LoRA 适配器:retrieval、text-matching、clustering 或 classification。对于经 API 的多模态输入,直接传递图像 URL、音频文件 URL、视频文件 URL 或 PDF URL——模型将每种模态路由到相应编码器。支持的音频格式包括 WAV、MP3、FLAC、OGG、M4A 和 Opus。视频输入按 32 帧均匀采样处理。可以在单个批次内自由混合模态:向量空间在所有模态间共享。使用余弦相似度进行比较。支持从 1024 到 32 维的 Matryoshka 截断。纯文本向量与 jina-embeddings-v5-text-small 即插即用兼容——升级时无需重建索引。对于无 GPU 的边缘部署,请改用 jina-embeddings-v5-omni-nano。

提及此模型的博客
五月 12, 2026 • 7 分钟阅读
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 标志
open_in_new
下载 Elastic 标志
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业使用,不面向消费者。