概述
jina-embedding-b-en-v1 是 Jina AI 首个公开发布的文本向量模型:一个 110M 参数的双向编码器,将英语文本映射到 768 维向量。它面向语义搜索、相似度比较和内容推荐而设计,彼时 512 token 上下文是行业标准,从而确立了 Jina 进入开源向量模型领域的地位。该模型现已成为遗留模型,被支持 8K+ token 上下文和多语输入的 v2 和 v3 系列取代。
方法
该模型使用 T5-编码器架构配合平均池化,产生固定长度的 768 维表示。训练遵循 Linnaeus-Clean 数据集上的两阶段对比方案(从 16 亿候选中过滤出 385M 句对):第一阶段用正例文本对进行 InfoNCE 损失以学习语义对齐;第二阶段用三元组损失以锐化相似但语义不同文本之间的判别。一个关键设计决策是平均池化策略,它对 token 级表示取平均,产生捕捉句子全局语义的单个向量。512 token 的上下文窗口在当时是标准,但限制了模型在长文档应用中的实用性。
性能
在 STS12 上,模型取得 0.751 的相关系数,发布时超过 all-mpnet-base-v2 和 all-minilm-l6-v2。它在标准英语句子向量任务上表现出色,同时保持适合生产环境的快速推理时间。其 512 token 上下文窗口和仅英语的定位使其不适合到 2025 年成为标准的长文档和多语工作负载。该模型已被 jina-embeddings-v2-base-en(8K 上下文、双向 ALiBi)和 jina-embeddings-v3(570M 参数、89 种语言、任务特定 LoRA 适配器)取代。
最佳实践
该模型为遗留模型,不应用于新项目。若从 jina-embedding-b-en-v1 迁移,请升级到 jina-embeddings-v5-text-small 以应对当前工作负载——它支持 32K token 上下文、89 种语言和任务特定 LoRA 适配器。对于代码特定的向量需求,请使用 jina-code-embeddings-1.5b。该模型需要支持 CUDA 的硬件以获得最佳性能,接受最多 512 token 的输入。它不适合多语内容、长文档或以代码为中心的应用。
