I/O 图
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
LongEmbed
66.39
Parameters
596M
Rank by score
8 / 69
Pareto front
Behind it
取值分布help_outlineAUC 0.8269
语料
翻译对
文档检索
代码
图像 / 头图
图像 / 标识
任务
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
相关10.9%
困难负例2.1%
无关0.9%
推荐阈值
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
均衡 · 0.697
AUC
0.8269
噪声上限
0.855
召回悬崖
0.566
测量样本对
119 / 11k
向量分量help_outline
σ 0.0313 · 244k 个数值
嵌入几何help_outline
各维度均值,悬停查看区间
噪声下限
0.300
有效维度
70 / 1024
维度截断help_outline
text-matching · 阈值随所请求维度的变化
语言对help_outline
各语言对之间的阈值跨度:0.024
选择要比较的模型
论文 (1)
概述
jina-embeddings-v5-text-small 是一个 0.6B 参数的多语言文本向量模型,基于 Qwen3-0.6B-Base 主干网络构建。它通过末词元池化生成 1024 维向量,并借助旋转位置编码(RoPE)与调整后的基频,支持最长 32K 词元的上下文。模型包含四个面向特定任务的 LoRA 适配器,分别用于检索、语义相似度、聚类和分类,均在冻结的主干网络权重之上独立训练。借助 Matryoshka 表示学习,向量最低可截断至 32 维。训练分两个阶段:先从 Qwen3-Embedding-4B 做向量蒸馏,迁移大型教师模型的知识;再针对每类任务用专门的损失函数训练对应适配器。模型支持以「Query:」和「Document:」前缀区分的非对称检索。
方法
训练分两个阶段。第一阶段做向量蒸馏,用投影后的学生向量与教师向量之间的余弦距离损失,把 Qwen3-Embedding-4B(40 亿参数的教师模型)的知识迁移到 Qwen3-0.6B-Base 学生模型。一个线性投影层负责把学生的 1024 维空间映射到教师的高维空间。通用蒸馏使用 300 多个数据集、覆盖 30 多种语言,训练 50,000 步;随后调整 RoPE 参数,在合成与真实长文档(1,000 至 4,096 词元)上做长上下文训练。第二阶段在冻结的主干网络权重之上训练四个 LoRA 适配器:检索适配器结合带难负样本的 InfoNCE 对比损失、持续蒸馏损失和全局正交正则项(GOR),以提升量化稳健性;文本匹配适配器用 CoSENT 排序损失处理分级相似度,对未打分的样本对则继续蒸馏;聚类适配器采用带聚类专用教师指令的再蒸馏;分类适配器采用双向 InfoNCE 损失,并辅以关系型知识蒸馏正则化。最终的检索适配器权重由多个检查点平均得到。
性能
在多语言基准 MMTEB 上,jina-embeddings-v5-text-small 取得任务级平均分 67.0、类型级平均分 58.9,在所有 10 亿参数以下的模型中位居第一。各项得分为:分类 71.3,聚类 53.4,配对分类 82.9,重排 65.7,检索 64.9,STS 78.9。英文 MTEB 平均分 71.7,优于带指令的 Qwen3-0.6B(70.5)和 jina-embeddings-v3(65.7)。检索类基准上,MTEB-M 检索 64.88,RTEB 66.84,BEIR 56.67,LongEmbed 66.39。该模型体量仅为教师模型 Qwen3-4B 的六分之一,却在配对分类上反超教师(MMTEB 上 42.0 对 26.8),其余各类成绩也都保持在同类前列。
最佳实践
请根据任务选择合适的 LoRA 适配器:「retrieval」用于非对称的查询-文档检索(查询前加「Query:」,段落前加「Document:」);「text-matching」用于查重、复述识别等对称相似度任务(两侧输入都用「Document:」前缀);「clustering」用于把相关文档归类;「classification」用于分类和情感分析。检索任务请务必使用正确的前缀,因为模型是按非对称编码训练的。借助 Matryoshka 截断,向量可从 1024 维降到最低 32 维;256 维以上性能依然稳健,低于该阈值则明显下滑,这与 Johnson-Lindenstrauss 定理的限制一致。得益于 GOR 正则化,二值量化的性能损失极小。32K 上下文窗口原生支持长文档,模型还额外在长上下文数据上做过训练,长文档检索更为稳健。向量比对请使用余弦相似度。该模型可通过 Jina AI API、Hugging Face(已集成 Sentence Transformers 和 vLLM)获取,也提供适用于 llama.cpp 的量化版本。
提及此模型的博客






