I/O 圖
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
LongEmbed
66.39
Parameters
596M
Rank by score
8 / 69
Pareto front
Behind it
取值分佈help_outlineAUC 0.8269
語料
翻譯對
文件檢索
程式碼
影象 / 頭圖
影象 / 標識
任務
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
相關10.9%
困難負例2.1%
無關0.9%
推薦閾值
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
均衡 · 0.697
AUC
0.8269
噪聲上限
0.855
召回懸崖
0.566
測量樣本對
119 / 11k
向量分量help_outline
σ 0.0313 · 244k 個數值
嵌入幾何help_outline
各維度均值,懸停檢視區間
噪聲下限
0.300
有效維度
70 / 1024
維度截斷help_outline
text-matching · 閾值隨所請求維度的變化
語言對help_outline
各語言對之間的閾值跨度:0.024
選擇要比較的模型
論文 (1)
概述
jina-embeddings-v5-text-small 是一個 0.6B 引數的多語言文字向量模型,基於 Qwen3-0.6B-Base 主幹網路構建。它透過末詞元池化生成 1024 維向量,並藉助旋轉位置編碼(RoPE)與調整後的基頻,支援最長 32K 詞元的上下文。模型包含四個面向特定任務的 LoRA 介面卡,分別用於檢索、語義相似度、聚類和分類,均在凍結的主幹網路權重之上獨立訓練。藉助 Matryoshka 表示學習,向量最低可截斷至 32 維。訓練分兩個階段:先從 Qwen3-Embedding-4B 做向量蒸餾,遷移大型教師模型的知識;再針對每類任務用專門的損失函式訓練對應介面卡。模型支援以「Query:」和「Document:」字首區分的非對稱檢索。
方法
訓練分兩個階段。第一階段做向量蒸餾,用投影后的學生向量與教師向量之間的餘弦距離損失,把 Qwen3-Embedding-4B(40 億參數的教師模型)的知識遷移到 Qwen3-0.6B-Base 學生模型。一個線性投影層負責把學生的 1024 維空間映射到教師的高維空間。通用蒸餾使用 300 多個資料集、覆蓋 30 多種語言,訓練 50,000 步;隨後調整 RoPE 參數,在合成與真實長文件(1,000 至 4,096 詞元)上做長上下文訓練。第二階段在凍結的主幹網路權重之上訓練四個 LoRA 適配器:檢索適配器結合帶難負樣本的 InfoNCE 對比損失、持續蒸餾損失和全域正交正則項(GOR),以提升量化穩健性;文本匹配適配器用 CoSENT 排序損失處理分級相似度,對未評分的樣本對則繼續蒸餾;聚類適配器採用帶聚類專用教師指令的再蒸餾;分類適配器採用雙向 InfoNCE 損失,並輔以關係型知識蒸餾正則化。最終的檢索適配器權重由多個檢查點平均得到。
效能
在多語言基準 MMTEB 上,jina-embeddings-v5-text-small 取得任務級平均分 67.0、型別級平均分 58.9,在所有 10 億引數以下的模型中位居第一。各項得分為:分類 71.3,聚類 53.4,配對分類 82.9,重排 65.7,檢索 64.9,STS 78.9。英文 MTEB 平均分 71.7,優於帶指令的 Qwen3-0.6B(70.5)和 jina-embeddings-v3(65.7)。檢索類基準上,MTEB-M 檢索 64.88,RTEB 66.84,BEIR 56.67,LongEmbed 66.39。該模型體量僅為教師模型 Qwen3-4B 的六分之一,卻在配對分類上反超教師(MMTEB 上 42.0 對 26.8),其餘各類成績也都保持在同類前列。
最佳實踐
請根據任務選擇合適的 LoRA 介面卡:「retrieval」用於非對稱的查詢-文件檢索(查詢前加「Query:」,段落前加「Document:」);「text-matching」用於查重、複述識別等對稱相似度任務(兩側輸入都用「Document:」字首);「clustering」用於把相關文件歸類;「classification」用於分類和情感分析。檢索任務請務必使用正確的字首,因為模型是按非對稱編碼訓練的。藉助 Matryoshka 截斷,向量可從 1024 維降到最低 32 維;256 維以上效能依然穩健,低於該閾值則明顯下滑,這與 Johnson-Lindenstrauss 定理的限制一致。得益於 GOR 正則化,二值量化的效能損失極小。32K 上下文視窗原生支援長文件,模型還額外在長上下文資料上做過訓練,長文件檢索更為穩健。向量比對請使用餘弦相似度。該模型可透過 Jina AI API、Hugging Face(已整合 Sentence Transformers 和 vLLM)獲取,也提供適用於 llama.cpp 的量化版本。
提及此模型的部落格






