I/O 圖 1
I/O 圖 2
I/O 圖 3
I/O 圖 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
RTEB public
66.84
Parameters
1.6B
Rank by score
14 / 62
Pareto front
Behind it
取值分佈help_outlineAUC 0.8269
語料
翻譯對
文件檢索
程式碼
影象 / 頭圖
影象 / 標識
任務
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
相關10.9%
困難負例2.1%
無關0.9%
推薦閾值
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
均衡 · 0.697
AUC
0.8269
噪聲上限
0.855
召回懸崖
0.566
測量樣本對
119 / 11k
該模型與 jina-embeddings-v5-text-small 共用文字塔。此處的分佈即為該模型的分佈,二者在 fp16 傳輸精度下一致。
向量分量help_outline
σ 0.0313 · 244k 個數值
嵌入幾何help_outline
各維度均值,懸停檢視區間
噪聲下限
0.300
有效維度
70 / 1024
維度截斷help_outline
text-matching · 閾值隨所請求維度的變化
語言對help_outline
各語言對之間的閾值跨度:0.024
選擇要比較的模型
論文 (1)
概述
jina-embeddings-v5-omni-small(約 17.4 億參數)是一款多模態向量模型,可接收文本、圖像、影片和音頻,並在與 jina-embeddings-v5-text-small 對齊的共享向量空間中輸出向量。您可以用文本建索引、用任意模態查詢,反之亦然,無需重建索引。多模態訓練期間,文本主幹網路和四個面向特定任務的 LoRA 適配器(檢索、文本匹配、聚類、分類)全部凍結,因此純文本輸出與 jina-embeddings-v5-text-small 逐位一致。模型輸出 1024 維向量,可通過 Matryoshka 截斷至最低 32 維,支援 32K 詞元的上下文長度。
方法
在 jina-embeddings-v5-text-small 之上增加第三階段訓練。文字主幹網路和四個面向特定任務的 LoRA 介面卡全部凍結,只訓練新增的跨模態投影器。影象和影片(均勻取樣 32 幀)由 SigLIP2 So400m 視覺編碼器處理,音訊輸入由 Whisper-large-v3 音訊編碼器處理,PDF 頁面則渲染成影象後走視覺通路。訓練採用帶跨模態難負樣本的對比損失,把視覺和音訊表示對齊到已有的文字向量空間。
效能
純文字效能與 jina-embeddings-v5-text-small 逐位一致,多模態訓練期間文字主幹網路和 LoRA 介面卡均未改動。跨模態檢索方面,模型在文字-影象、文字-音訊和文字-影片任務上都展現出良好的對齊效果,PDF 頁面檢索則走視覺通路完成。在 Jina 的多模態向量模型中,omni-small 在伺服器部署場景下的精度與效率平衡最佳。
最佳實踐
介面卡與 v5-text-small 相同,仍是檢索、文字匹配、聚類、分類四個。透過 API 傳入多模態輸入時,直接傳影象 URL、音訊檔案 URL、影片檔案 URL 或 PDF URL 即可,模型會把各模態分派給對應的編碼器。支援的音訊格式包括 WAV、MP3、FLAC、OGG、M4A 和 Opus。影片輸入按均勻取樣的 32 幀處理。同一批次內可自由混合不同模態,因為所有模態共享同一向量空間。比對請使用餘弦相似度。支援從 1024 維到 32 維的 Matryoshka 截斷。純文字向量與 jina-embeddings-v5-text-small 完全相容,升級時無需重建索引。
提及此模型的部落格



