Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
向量模型
copyright CC BY-NC 4.0
open_in_new 釋出部落格

jina-embeddings-v5-omni-small

支援文字、圖片、音訊、影片和 PDF 的多模態向量模型
許可證
copyright CC-BY-NC-4.0
釋出日期
calendar_month
2026-05-07
輸入
abc
文字
image
圖片
audiotrack
音訊
videocam
影片
picture_as_pdf
PDF
arrow_forward
輸出
more_horiz
向量
Matryoshka 維度 help_outline
32
64
128
256
512
768
1024
模型詳情
參數: 1.7B
輸入詞元長度: 32K
輸出維度: 1024
底座模型 help_outline
link
jina-embeddings-v5-text-small
open_in_new
SigLIP2 Large
open_in_new
Whisper-large-v3
已訓練語言 help_outline
32 種語言
支援的語言 help_outline
93 種語言
量化 help_outline
GGUF
Apple 晶片支援 help_outline
MLX
相關模型
link
jina-embeddings-v5-omni-nano
link
jina-embeddings-v5-text-small
link
jina-embeddings-v3
link
jina-clip-v2
支援的任務
search 檢索
compare_arrows 文字匹配
bubble_chart 聚類
label 分類
可透過以下方式獲取
Elastic Inference Service
Jina API
AWS SageMaker
Hugging Face
物理隔離
I/O 圖 1

文字

jina-embeddings-v5-omni-small

圖片

任務

向量

I/O 圖 2

文字

jina-embeddings-v5-omni-small

音訊

任務

向量

I/O 圖 3

文字

jina-embeddings-v5-omni-small

影片

任務

向量

I/O 圖 4

多個

向量

文字

jina-embeddings-v5-omni-small

PDF

任務

帕累託前緣help_outline
MMTEB
RTEB public
MIEB
MAEB
chevron_leftchevron_right
300M1B3.0B10B20304050BidirLM-Omni-2.5B-Embed…e5-omni-3Be5-omni-7Bjina-embeddings-v5-omni…LanguageBindlarger_clap_generallarger_clap_musicLCO-Embedding-Omni-3Bmsclap-2022MuQ-MuLan-largeOmni-Embed-Nemotron-3BQwen2-Audio-7BQwen2.5-Omni-3Bspeecht5_multimodalwav2clipjina-embeddings-v5-omni…參數量(對數)score
本模型
在前緣上
Jina AI
其他
MAEB
49.96
參數量
1.6B
按分數的排名
5 / 21
帕累託前緣
在前緣上
取值分佈help_outline
AUC 0.8269
語料
翻譯對
文件檢索
程式碼
圖片 / 頭圖
圖片 / 標識
任務
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
相關10.9%
困難負例2.1%
無關0.9%
推薦閾值
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
均衡 · 0.697
AUC
0.8269
噪聲上限
0.855
召回懸崖
0.566
測量樣本對
119 / 11k
該模型與 jina-embeddings-v5-text-small 共用文字塔。此處的分佈即為該模型的分佈,二者在 fp16 傳輸精度下一致。
向量分量help_outline
-0.160.010.18
σ 0.0313 · 244k 個數值
向量幾何help_outline
01024
各維度均值,懸停檢視區間
噪聲下限
0.300
有效維度
70 / 1024
維度截斷help_outline
32641282565121024
text-matching · 閾值隨所請求維度的變化
語言對help_outline
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.024
選擇要比較的模型
論文 (1)
SIGIR 2026
五月 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers

概述

jina-embeddings-v5-omni-small 是一個約 1.74B 參數的多模態向量模型,可接受文字、圖像、影片、音訊和 PDF,在共享的 1024 維向量空間中生成向量。它是 Jina API 的預設向量模型,在 Jina 的多模態向量模型中提供最佳的精度-效率權衡。純文字輸出與 jina-embeddings-v5-text-small 按位相同,無需重建索引即可從純文字無縫遷移到多模態。

方法

該模型在擴展 jina-embeddings-v5-text-small 的第三階段訓練。多模態訓練期間,Qwen3-0.6B-Base 文字骨幹和全部四個任務特定 LoRA 適配器均被凍結,只有跨模態投影器是新訓練的。SigLIP2 Large 視覺編碼器處理圖像和影片(每影片均勻取樣 32 幀)。Whisper-large-v3 音訊編碼器處理音訊輸入。PDF 頁面渲染為圖像,經視覺通路處理。訓練使用帶跨模態困難負樣本的對比損失,將視覺和音訊表示與現有文字向量空間對齊。1024 維輸出支援 Matryoshka 截斷至 32 維。32K token 上下文視窗覆蓋文字輸入。該模型支援 Apple Silicon 的量化推理和 MLX 推理。

效能

純文字效能與 jina-embeddings-v5-text-small(MMTEB 任務級平均 67.0,英文 MTEB 71.7)按位相同——多模態訓練期間文字骨幹和 LoRA 適配器未受改動。在跨模態檢索中,該模型在文字-圖像、文字-音訊和文字-影片任務上表現出強對齊。PDF 頁面檢索經視覺通路處理。omni-small 模型為伺服器部署在 Jina 多模態向量模型中提供最佳的精度-效率權衡,其 1024 維向量比 768 維的 omni-nano 變體具有更強的判別力。

最佳實踐

選擇適當的 LoRA 適配器:retrieval、text-matching、clustering 或 classification。對於經 API 的多模態輸入,直接傳遞圖像 URL、音訊檔案 URL、影片檔案 URL 或 PDF URL——模型將每種模態路由到相應編碼器。支援的音訊格式包括 WAV、MP3、FLAC、OGG、M4A 和 Opus。影片輸入按 32 幀均勻取樣處理。可以在單一批次內自由混合模態:向量空間在所有模態間共享。使用餘弦相似度進行比較。支援從 1024 到 32 維的 Matryoshka 截斷。純文字向量與 jina-embeddings-v5-text-small 即插即用相容——升級時無需重建索引。對於無 GPU 的邊緣部署,請改用 jina-embeddings-v5-omni-nano。

提及此模型的部落格
五月 12, 2026 • 7 分鐘閱讀
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 標誌
open_in_new
下載 Elastic 標誌
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業使用,不面向消費者。