I/O 图
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
选择要比较的模型
论文 (1)
概述
Jina Embedding B v1 是一款专用的文本向量模型,可将英文文本转换为高维数值表示并保留语义信息。它满足了生产环境对高效、精准文本向量的迫切需求,尤其适合需要在计算效率与向量质量之间取得平衡的团队。该模型以 1.1 亿参数生成 768 维向量,无需大量算力即可支撑语义搜索、文档聚类或内容推荐系统的落地。
方法
该模型采用基于 T5 编码器的架构,配合均值池化生成定长表示。训练数据为精心构建的 Linnaeus-Clean 数据集,从最初的 16 亿对句子中筛选出 3.85 亿对高质量句对。训练分两个阶段:第一阶段在文本对上用 InfoNCE 损失做对比学习;第二阶段引入三元组训练,进一步提升模型区分相似与不相似内容的能力。这套创新的训练方法,加上语言检测、一致性校验等严格的数据过滤,让模型能够有效捕捉细微的语义关联。
性能
在实际评估中,Jina Embedding B v1 表现不俗,尤其是在语义文本相似度任务上。它在 STS12 上以 0.751 的成绩达到业界领先水平,超过 all-mpnet-base-v2、all-minilm-l6-v2 等成熟模型。它在各类基准上均有稳定发挥,推理耗时也控制得当。不过请注意,该模型专为英文内容优化,在多语言或代码类任务上可能表现欠佳。目前它已由 jina-embeddings-v2-base-en 和 jina-embeddings-v3 接替,后两者在更广泛的场景中表现更强。
最佳实践
要获得最佳部署效果,模型需要支持 CUDA 的 GPU,不过体积适中,在普通硬件上也能高效推理。它支持最长 512 词元的输入序列,特别适合对向量生成的稳定性和可靠性要求较高的生产环境。该模型在英文内容上表现最佳,非常适合语义搜索、文档相似度比对和内容推荐等场景。新项目建议改用更新的 v2 或 v3 版本,它们性能更好、语言覆盖更广。若任务需要多语言理解,或涉及通用英文文本之外的专业领域知识,则不建议使用本模型。
