概述
jina-embeddings-v5-text-nano 是构建在 EuroBERT-210M 骨干上的 239M 参数多语言文本向量模型。它支持 8K token 上下文,生成可用 Matryoshka 截断至 32 维的 768 维向量,并交付 Jina 的 500M 以下向量家族中每参数最高精度。专为无完整 GPU 可用的边缘部署、延迟敏感应用和资源受限环境而设计。
方法
该模型基于 EuroBERT-210M——一个在覆盖 15 种主要语言的多语言数据上预训练的紧凑双向编码器。它采用 Last-Token-Pooling 从最终 token 表示生成向量。训练遵循两阶段蒸馏方案:首先,从更大的教师模型进行知识蒸馏以转移向量质量;其次,用任务特定的对比损失在检索、文本匹配、聚类和分类任务上微调模型。Matryoshka Representation Learning 允许在任何受支持尺寸(32、64、128、256、512、768)截断向量维度,同时保持强性能。Geometric Orthogonal Regularization(GOR)将二进制量化下的性能退化限制在 MTEB 检索上不到 2 分。8K 上下文窗口实现无需分块的长文档处理。
性能
在 MMTEB(多语言)上,该模型仅以 239M 参数取得任务级平均 65.5 和类型级平均 57.7,超越了 500M 以下的所有模型,包括 KaLM-mini-v2.5(60.1,494M)、voyage-4-nano(58.9,480M)和 Gemma-300M(61.1,308M)。任务级分数:分类 69.2、聚类 52.7、成对分类 81.9、重排序 64.6、检索 63.3、STS 78.2。在英文 MTEB 上,它取得 71.0 平均,几乎追平大得多的 jina-embeddings-v5-text-small(71.7)。检索专项:MTEB-M 63.26、RTEB 64.08、BEIR 56.06、LongEmbed 63.65。得益于 GOR 正则化,向量在二进制量化下依然稳健。
最佳实践
选择合适的任务前缀:非对称查询-文档检索用 'retrieval',对称相似度用 'text-matching',分组用 'clustering',分类用 'classification'。Matryoshka 截断到 256 维可保留 95% 以上的检索质量,同时减少 67% 的存储。支持二进制量化以进一步减少存储。EuroBERT 骨干为包括英语、法语、德语、西班牙语、中文、日语、阿拉伯语和印地语在内的 15 种主要语言提供强覆盖。使用余弦相似度比较向量。可通过 Jina AI API、Hugging Face(Sentence Transformers、vLLM)和 llama.cpp 的量化变体获取。对于需要 32K 上下文或更高精度的工作负载,请改用 jina-embeddings-v5-text-small。






