概述
jina-embeddings-v5-omni-nano 是一個約 1.04B 參數的多模態向量模型,可接受文字、圖像、影片和音訊,在共享向量空間中生成向量。它是 v5-omni 家族的緊湊變體,專為無 GPU 可用的邊緣和通用硬體而設計。純文字輸出與 jina-embeddings-v5-text-nano 按位相同,使其成為從純文字到多模態的即插即用升級,無需重建索引。
方法
該模型透過第三階段訓練從 jina-embeddings-v5-text-nano 擴展出多模態能力。EuroBERT-210M 文字骨幹和全部四個任務特定 LoRA 適配器均被凍結,只有跨模態投影器是新訓練的。SigLIP2 Base 視覺編碼器處理圖像和影片(每影片均勻取樣 32 幀)。Whisper-large-v3 音訊編碼器處理音訊輸入。PDF 頁面渲染為圖像,經視覺通路處理。訓練使用帶跨模態困難負樣本的對比損失,將視覺和音訊表示與現有文字向量空間對齊。768 維輸出空間支援 Matryoshka 截斷至 32 維。8K token 上下文視窗覆蓋文字輸入,圖像和音訊輸入經各自編碼器處理。
效能
純文字效能與 jina-embeddings-v5-text-nano(MMTEB 任務級平均 65.5,英文 MTEB 71.0)按位相同。多模態效能因 768 維向量空間(對照 1024)較窄和文字骨幹較小,略低於 jina-embeddings-v5-omni-small,但在文字-圖像、文字-音訊和文字-影片檢索上保持強跨模態對齊。該模型針對 CPU 和邊緣硬體最佳化,在這些環境中更大的 omni-small 模型無法高效執行。跨模態檢索品質在其尺寸級別中具有競爭力。
最佳實踐
與 jina-embeddings-v5-omni-small 相同的使用模式:選擇適當的 LoRA 適配器(retrieval、text-matching、clustering、classification),並直接經 API 傳遞圖像 URL、音訊檔案 URL、影片檔案 URL 或 PDF URL——模型將每種模態路由到相應編碼器。支援的音訊格式:WAV、MP3、FLAC、OGG、M4A、Opus。影片輸入按 32 幀均勻取樣處理。可以在單一批次內自由混合模態;向量空間在所有模態間共享。使用餘弦相似度進行比較。支援從 768 到 32 維的 Matryoshka 截斷。純文字向量與 jina-embeddings-v5-text-nano 即插即用相容——升級時無需重建索引。對於需要更高精度的伺服器部署,請使用 jina-embeddings-v5-omni-small(1024 維,更大的骨幹)。



