概述
jina-embeddings-v4 是一個 3.8B 參數的多模態向量模型,將文字和影像表示統一在單一架構中。它獨特地支援單向量(dense)和多向量(late-interaction/ColBERT 風格)兩種輸出模式,使團隊無需切換模型即可在索引效率和檢索精度之間權衡。該模型在視覺豐富的文件檢索上取得 SOTA 效能,原生處理表格、圖表、示意圖和混合媒體格式。
方法
該架構將大型 transformer 編碼器主幹與基於 Qwen2.5-VL 的視覺編碼器相結合,透過共享注意力層處理文字(最多 32K token)和影像(768×28×28 補丁)。三個任務特定的 LoRA 適配器(各 60M 參數)使模型專門用於:非對稱查詢-文件檢索、語意文字相似性和程式碼搜尋。雙輸出設計是關鍵創新:模型可以生成單個 2048 維 dense 向量(用於快速 ANN 索引,可經 Matryoshka 截斷到 128 維),或一組 128 維 token 級向量用於 late-interaction 打分。訓練採用兩階段課程:在文字-影像和文字-文字對上聯合對比預訓練,然後是任務特定的 LoRA 適配器訓練。對超出 32K token 上下文視窗的文件支援 late chunking。適用 Qwen Research License。
效能
在 JinaVDR(視覺文件檢索)上,該模型平均得分 72.19,而 ColPali-v1.2 為 64.50。在 ViDoRe 上,它取得平均 84.11(多向量模式下 90.17),而 ColPali 為 83.90。跨模態檢索在 CLIP 基準上達到 84.11,超過 jina-clip-v2(81.12)和 nllb-clip-large-siglip(83.19)。文字檢索得分:MTEB-en 55.97、MMTEB 66.49、LongEmbed 67.11(jina-embeddings-v3 為 55.66)。語意相似度在 English STS 上達到 85.89,多語言 STS 上 72.70。程式碼檢索在 CoIR 上得分 71.59。跨模態對齊達到 0.71 餘弦相似度(OpenAI CLIP 為 0.15)。多向量模式在視覺豐富任務上一致優於單向量模式;單向量模式為標準文字檢索提供高效性能。
最佳實踐
根據流水線選擇輸出模式:大規模 ANN 索引用單向量(可用 Matryoshka 截斷到 128–512 維),視覺豐富文件的 top-k 候選重排序用多向量。透過 API 任務參數選擇 LoRA 適配器:查詢-文件搜尋用 'retrieval',語意相似性用 'text-matching',程式碼檢索用 'code'。對超過 32K token 的文件,使用 `late_chunking。每個 LoRA 適配器的 60M 參數開銷可忽略(記憶體增加 <2%),且三個適配器可同時載入。該模型在 Qwen Research License 下授權(無商用許可證不得商用)。生產部署請使用支援 CUDA 的 GPU;該模型可透過 Jina API、AWS、Azure 和 GCP 市場取得。純文字工作負載可考慮 jina-embeddings-v5-text-small`,它以一小部分計算成本提供更高的每參數精度。
Qwen 研究許可證 









