概述
jina-embeddings-v5-omni-small 是一個約 1.74B 參數的多模態向量模型,可接受文字、圖像、影片、音訊和 PDF,在共享的 1024 維向量空間中生成向量。它是 Jina API 的預設向量模型,在 Jina 的多模態向量模型中提供最佳的精度-效率權衡。純文字輸出與 jina-embeddings-v5-text-small 按位相同,無需重建索引即可從純文字無縫遷移到多模態。
方法
該模型在擴展 jina-embeddings-v5-text-small 的第三階段訓練。多模態訓練期間,Qwen3-0.6B-Base 文字骨幹和全部四個任務特定 LoRA 適配器均被凍結,只有跨模態投影器是新訓練的。SigLIP2 Large 視覺編碼器處理圖像和影片(每影片均勻取樣 32 幀)。Whisper-large-v3 音訊編碼器處理音訊輸入。PDF 頁面渲染為圖像,經視覺通路處理。訓練使用帶跨模態困難負樣本的對比損失,將視覺和音訊表示與現有文字向量空間對齊。1024 維輸出支援 Matryoshka 截斷至 32 維。32K token 上下文視窗覆蓋文字輸入。該模型支援 Apple Silicon 的量化推理和 MLX 推理。
效能
純文字效能與 jina-embeddings-v5-text-small(MMTEB 任務級平均 67.0,英文 MTEB 71.7)按位相同——多模態訓練期間文字骨幹和 LoRA 適配器未受改動。在跨模態檢索中,該模型在文字-圖像、文字-音訊和文字-影片任務上表現出強對齊。PDF 頁面檢索經視覺通路處理。omni-small 模型為伺服器部署在 Jina 多模態向量模型中提供最佳的精度-效率權衡,其 1024 維向量比 768 維的 omni-nano 變體具有更強的判別力。
最佳實踐
選擇適當的 LoRA 適配器:retrieval、text-matching、clustering 或 classification。對於經 API 的多模態輸入,直接傳遞圖像 URL、音訊檔案 URL、影片檔案 URL 或 PDF URL——模型將每種模態路由到相應編碼器。支援的音訊格式包括 WAV、MP3、FLAC、OGG、M4A 和 Opus。影片輸入按 32 幀均勻取樣處理。可以在單一批次內自由混合模態:向量空間在所有模態間共享。使用餘弦相似度進行比較。支援從 1024 到 32 維的 Matryoshka 截斷。純文字向量與 jina-embeddings-v5-text-small 即插即用相容——升級時無需重建索引。對於無 GPU 的邊緣部署,請改用 jina-embeddings-v5-omni-nano。



