I/O 图

文本

jina-embeddings-v5-text-small

任务

向量

帕累托前沿
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embeddings-v5-text…参数量(对数)nDCG@10
本模型
在前沿上
Jina AI
其他
MTEB English · retrieval
60.07
参数量
596M
按分数的排名
3 / 39
帕累托前沿
在前沿之后
取值分布
AUC 0.8269
语料
翻译对
文档检索
代码
图片 / 头图
图片 / 标识
任务
classification
clustering
retrieval.passage
retrieval.query
retrieval.query → retrieval.passage
text-matching
0.8080.400.500.600.700.800.90
相关10.9%
困难负例2.1%
无关0.9%
推荐阈值
FPR 0.1 · 0.717
FPR 0.01 · 0.808
FPR 0.001 · 0.860
FPR 0.0001 · 0.878
均衡 · 0.697
AUC
0.8269
噪声上限
0.855
召回悬崖
0.566
测量样本对
119 / 11k
向量分量
-0.160.010.18
σ 0.0313 · 244k 个数值
向量几何
01024
各维度均值,悬停查看区间
噪声下限
0.300
有效维度
70 / 1024
维度截断
32641282565121024
text-matching · 阈值随所请求维度的变化
语言对
de-ruen-deen-koen-zhja-ko
各语言对之间的阈值跨度:0.024
选择要比较的模型
论文 (1)

概述

jina-embeddings-v5-text-small 是构建在 Qwen3-0.6B-Base 骨干上的 677M 参数多语言文本向量模型。它支持 32K token 上下文,生成可用 Matryoshka 截断至 32 维的 1024 维向量,并取得 1B 参数以下所有模型中最高 MTEB 平均。它是 Jina API 的默认向量模型,也是生产级 RAG 管线的首选推荐。

方法

该模型构建在 Qwen3-0.6B-Base 上,这是一个在 119 种语言上预训练的多语言的语言模型。它采用 Last-Token-Pooling 生成向量。训练遵循两阶段方案:(1) 从 Qwen3-Embedding-4B(4B 参数教师模型)进行向量蒸馏,将高质量向量表示转移到 677M 学生模型;(2) 任务特定的对比损失在检索、文本匹配、聚类和分类任务上微调模型。Geometric Orthogonal Regularization(GOR)确保向量在二进制量化下以最小性能损失保持稳健。Matryoshka Representation Learning 允许将维度从 1024 截断到 32,同时在 256 维以上保持强检索质量。32K 上下文窗口通过调整基频的旋转位置编码实现,模型还额外在长上下文数据上训练以获得稳健的长文档检索。

性能

在 MMTEB(多语言)上,该模型取得任务级平均 67.0 和类型级平均 58.9,是 1B 参数以下所有模型中最高的。任务级分数:分类 71.3、聚类 53.4、成对分类 82.9、重排序 65.7、检索 64.9、STS 78.9。在英文 MTEB 上,它取得 71.7 平均,超越了带指令的 Qwen3-0.6B(70.5)和 jina-embeddings-v3(65.7)。检索专项:MTEB-M 64.88、RTEB 66.84、BEIR 56.67、LongEmbed 66.39。值得注意的是,该模型在成对分类上超越了其 4B 教师 Qwen3-Embedding-4B(MMTEB 42.0 对 26.8),同时体积小 6 倍,表明蒸馏与任务特定对比训练相结合可以在特定任务上超越教师性能。

最佳实践

选择合适的 LoRA 适配器:非对称查询-文档检索用 'retrieval'(查询前缀 'Query:',段落前缀 'Document:'),对称相似度用 'text-matching'(两个输入都用 'Document:' 前缀),分组相关文档用 'clustering',分类和情感分析用 'classification'。Matryoshka 截断到 256–512 维适合存储受限的索引;重排序请使用完整的 1024 维。支持二进制量化,性能损失极小。32K 上下文窗口原生处理长文档,无需分块。使用余弦相似度比较向量。可通过 Jina AI API、Hugging Face(Sentence Transformers、vLLM)和 llama.cpp 的量化变体获取。对于多模态工作负载,请改用 jina-embeddings-v5-omni-small。

提及此模型的博客