概述
jina-embeddings-v5-text-small 是構建在 Qwen3-0.6B-Base 骨幹上的 677M 參數多語言文字向量模型。它支援 32K token 上下文,生成可用 Matryoshka 截斷至 32 維的 1024 維向量,並取得 1B 參數以下所有模型中最高 MTEB 平均。它是 Jina API 的預設向量模型,也是生產級 RAG 管線的首選推薦。
方法
該模型構建在 Qwen3-0.6B-Base 上,這是一個在 119 種語言上預訓練的多語言的語言模型。它採用 Last-Token-Pooling 生成向量。訓練遵循兩階段方案:(1) 從 Qwen3-Embedding-4B(4B 參數教師模型)進行向量蒸餾,將高品質向量表示轉移到 677M 學生模型;(2) 任務特定的對比損失在檢索、文字匹配、群聚和分類任務上微調模型。Geometric Orthogonal Regularization(GOR)確保向量在二進位量化下以最小效能損失保持穩健。Matryoshka Representation Learning 允許將維度從 1024 截斷到 32,同時在 256 維以上保持強檢索品質。32K 上下文視窗透過調整基頻的旋轉位置編碼實現,模型還額外在長上下文資料上訓練以獲得穩健的長文件檢索。
效能
在 MMTEB(多語言)上,該模型取得任務級平均 67.0 和類型級平均 58.9,是 1B 參數以下所有模型中最高的。任務級分數:分類 71.3、群聚 53.4、成對分類 82.9、重排序 65.7、檢索 64.9、STS 78.9。在英文 MTEB 上,它取得 71.7 平均,超越了帶指令的 Qwen3-0.6B(70.5)和 jina-embeddings-v3(65.7)。檢索專項:MTEB-M 64.88、RTEB 66.84、BEIR 56.67、LongEmbed 66.39。值得注意的是,該模型在成對分類上超越了其 4B 教師 Qwen3-Embedding-4B(MMTEB 42.0 對 26.8),同時體積小 6 倍,表明蒸餾與任務特定對比訓練相結合可以在特定任務上超越教師效能。
最佳實踐
選擇適當的 LoRA 適配器:非對稱查詢-文件檢索用 'retrieval'(查詢前綴 'Query:',段落前綴 'Document:'),對稱相似度用 'text-matching'(兩個輸入都用 'Document:' 前綴),群組相關文件用 'clustering',分類和情感分析用 'classification'。Matryoshka 截斷到 256–512 維適合儲存受限的索引;重排序請使用完整的 1024 維。支援二進位量化,效能損失極小。32K 上下文視窗原生處理長文件,無需分塊。使用餘弦相似度比較向量。可透過 Jina AI API、Hugging Face(Sentence Transformers、vLLM)和 llama.cpp 的量化變體取得。對於多模態工作負載,請改用 jina-embeddings-v5-omni-small。






