概述
jina-embeddings-v5-text-small 是构建在 Qwen3-0.6B-Base 骨干上的 677M 参数多语言文本向量模型。它支持 32K token 上下文,生成可用 Matryoshka 截断至 32 维的 1024 维向量,并取得 1B 参数以下所有模型中最高 MTEB 平均。它是 Jina API 的默认向量模型,也是生产级 RAG 管线的首选推荐。
方法
该模型构建在 Qwen3-0.6B-Base 上,这是一个在 119 种语言上预训练的多语言的语言模型。它采用 Last-Token-Pooling 生成向量。训练遵循两阶段方案:(1) 从 Qwen3-Embedding-4B(4B 参数教师模型)进行向量蒸馏,将高质量向量表示转移到 677M 学生模型;(2) 任务特定的对比损失在检索、文本匹配、聚类和分类任务上微调模型。Geometric Orthogonal Regularization(GOR)确保向量在二进制量化下以最小性能损失保持稳健。Matryoshka Representation Learning 允许将维度从 1024 截断到 32,同时在 256 维以上保持强检索质量。32K 上下文窗口通过调整基频的旋转位置编码实现,模型还额外在长上下文数据上训练以获得稳健的长文档检索。
性能
在 MMTEB(多语言)上,该模型取得任务级平均 67.0 和类型级平均 58.9,是 1B 参数以下所有模型中最高的。任务级分数:分类 71.3、聚类 53.4、成对分类 82.9、重排序 65.7、检索 64.9、STS 78.9。在英文 MTEB 上,它取得 71.7 平均,超越了带指令的 Qwen3-0.6B(70.5)和 jina-embeddings-v3(65.7)。检索专项:MTEB-M 64.88、RTEB 66.84、BEIR 56.67、LongEmbed 66.39。值得注意的是,该模型在成对分类上超越了其 4B 教师 Qwen3-Embedding-4B(MMTEB 42.0 对 26.8),同时体积小 6 倍,表明蒸馏与任务特定对比训练相结合可以在特定任务上超越教师性能。
最佳实践
选择合适的 LoRA 适配器:非对称查询-文档检索用 'retrieval'(查询前缀 'Query:',段落前缀 'Document:'),对称相似度用 'text-matching'(两个输入都用 'Document:' 前缀),分组相关文档用 'clustering',分类和情感分析用 'classification'。Matryoshka 截断到 256–512 维适合存储受限的索引;重排序请使用完整的 1024 维。支持二进制量化,性能损失极小。32K 上下文窗口原生处理长文档,无需分块。使用余弦相似度比较向量。可通过 Jina AI API、Hugging Face(Sentence Transformers、vLLM)和 llama.cpp 的量化变体获取。对于多模态工作负载,请改用 jina-embeddings-v5-omni-small。






