I/O 圖

文字

jina-embeddings-v5-text-nano

任務

向量

帕累託前緣
30M100M300M1B3.0B10B30B3040506070all-MiniLM-L6-v2bge-large-en-v1.5e5-large-v2e5-small-v2EmbeddingGemma-300Mgranite-embedding-311m-…granite-embedding-97m-m…GritLM-7BGritLM-8x7Bgte-Qwen2-7B-instructharrier-oss-v1-0.6bharrier-oss-v1-27bjina-embeddings-v3jina-embeddings-v5-omni…KaLM-Embedding-Gemma3-1…LaBSELanguageBindLCO-Embedding-Omni-3Bllama-embed-nemotron-8bmultilingual-e5-basemultilingual-e5-large-i…Omni-Embed-Nemotron-3Bpotion-multilingual-128MQwen3-Embedding-0.6BQwen3-Embedding-4BQwen3-Embedding-8Bsnowflake-arctic-embed-…static-similarity-mrl-m…stella_en_1.5B_v5stella_en_400M_v5jina-embeddings-v5-text…參數量(對數)score
本模型
在前緣上
Jina AI
其他
MMTEB
65.50
參數量
212M
按分數的排名
12 / 48
帕累託前緣
在前緣上
取值分佈
AUC 0.8242
語料
翻譯對
文件檢索
程式碼
圖片 / 頭圖
圖片 / 標識
任務
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.7930.400.500.600.700.80
相關20.2%
困難負例1.7%
無關1.1%
推薦閾值
FPR 0.1 · 0.722
FPR 0.01 · 0.793
FPR 0.001 · 0.841
FPR 0.0001 · 0.865
均衡 · 0.678
AUC
0.8242
噪聲上限
0.840
召回懸崖
0.557
測量樣本對
119 / 11k
向量分量
-0.180.000.19
σ 0.0361 · 183k 個數值
向量幾何
0768
各維度均值,懸停檢視區間
噪聲下限
0.288
有效維度
69 / 768
維度截斷
3264128256512768
text-matching · 閾值隨所請求維度的變化
語言對
de-ruen-deen-koen-zhja-ko
各語言對之間的閾值跨度:0.027
選擇要比較的模型
論文 (1)

概述

jina-embeddings-v5-text-nano 是構建在 EuroBERT-210M 骨幹上的 239M 參數多語言文本向量模型。它支援 8K token 上下文,生成可用 Matryoshka 截斷至 32 維的 768 維向量,並交付 Jina 的 500M 以下向量家族中每參數最高精度。專為無完整 GPU 可用的邊緣部署、延遲敏感應用和資源受限環境而設計。

方法

該模型基於 EuroBERT-210M——一個在覆蓋 15 種主要語言的多語言資料上預訓練的緊湊雙向編碼器。它採用 Last-Token-Pooling 從最終 token 表示生成向量。訓練遵循兩階段蒸餾方案:首先,從更大的教師模型進行知識蒸餾以轉移向量品質;其次,用任務特定的對比損失在檢索、文字匹配、群聚和分類任務上微調模型。Matryoshka Representation Learning 允許在任何受支援尺寸(32、64、128、256、512、768)截斷向量維度,同時保持強效能。Geometric Orthogonal Regularization(GOR)將二進位量化下的效能退化限制在 MTEB 檢索上不到 2 分。8K 上下文視窗實現無需分塊的長文件處理。

效能

在 MMTEB(多語言)上,該模型僅以 239M 參數取得任務級平均 65.5 和類型級平均 57.7,超越了 500M 以下的所有模型,包括 KaLM-mini-v2.5(60.1,494M)、voyage-4-nano(58.9,480M)和 Gemma-300M(61.1,308M)。任務級分數:分類 69.2、群聚 52.7、成對分類 81.9、重排序 64.6、檢索 63.3、STS 78.2。在英文 MTEB 上,它取得 71.0 平均,幾乎追平大得多的 jina-embeddings-v5-text-small(71.7)。檢索專項:MTEB-M 63.26、RTEB 64.08、BEIR 56.06、LongEmbed 63.65。得益於 GOR 正則化,向量在二進位量化下依然穩健。

最佳實踐

選擇適當的任務前綴:非對稱查詢-文件檢索用 'retrieval',對稱相似度用 'text-matching',群組用 'clustering',分類用 'classification'。Matryoshka 截斷到 256 維可保留 95% 以上的檢索品質,同時減少 67% 的儲存。支援二進位量化以進一步減少儲存。EuroBERT 骨幹為包括英文、法文、德文、西班牙文、中文、日文、阿拉伯文和印地文在內的 15 種主要語言提供強覆蓋。使用餘弦相似度比較向量。可透過 Jina AI API、Hugging Face(Sentence Transformers、vLLM)和 llama.cpp 的量化變體取得。對於需要 32K 上下文或更高精度的工作負載,請改用 jina-embeddings-v5-text-small。

提及此模型的部落格