I/O 图

文本

jina-embedding-b-en-v1

向量

帕累托前沿
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1参数量(对数)Spearman
本模型
在前沿上
Jina AI
其他
MTEB English · sts
79.93
参数量
110M
按分数的排名
28 / 39
帕累托前沿
在前沿之后
选择要比较的模型
论文 (1)

概述

jina-embedding-b-en-v1 是 Jina AI 首个公开发布的文本向量模型:一个 110M 参数的双向编码器,将英语文本映射到 768 维向量。它面向语义搜索、相似度比较和内容推荐而设计,彼时 512 token 上下文是行业标准,从而确立了 Jina 进入开源向量模型领域的地位。该模型现已成为遗留模型,被支持 8K+ token 上下文和多语输入的 v2 和 v3 系列取代。

方法

该模型使用 T5-编码器架构配合平均池化,产生固定长度的 768 维表示。训练遵循 Linnaeus-Clean 数据集上的两阶段对比方案(从 16 亿候选中过滤出 385M 句对):第一阶段用正例文本对进行 InfoNCE 损失以学习语义对齐;第二阶段用三元组损失以锐化相似但语义不同文本之间的判别。一个关键设计决策是平均池化策略,它对 token 级表示取平均,产生捕捉句子全局语义的单个向量。512 token 的上下文窗口在当时是标准,但限制了模型在长文档应用中的实用性。

性能

在 STS12 上,模型取得 0.751 的相关系数,发布时超过 all-mpnet-base-v2 和 all-minilm-l6-v2。它在标准英语句子向量任务上表现出色,同时保持适合生产环境的快速推理时间。其 512 token 上下文窗口和仅英语的定位使其不适合到 2025 年成为标准的长文档和多语工作负载。该模型已被 jina-embeddings-v2-base-en(8K 上下文、双向 ALiBi)和 jina-embeddings-v3570M 参数、89 种语言、任务特定 LoRA 适配器)取代。

最佳实践

该模型为遗留模型,不应用于新项目。若从 jina-embedding-b-en-v1 迁移,请升级到 jina-embeddings-v5-text-small 以应对当前工作负载——它支持 32K token 上下文、89 种语言和任务特定 LoRA 适配器。对于代码特定的向量需求,请使用 jina-code-embeddings-1.5b。该模型需要支持 CUDA 的硬件以获得最佳性能,接受最多 512 token 的输入。它不适合多语内容、长文档或以代码为中心的应用。