概述
jina-embeddings-v2-base-en 是一个 137M 参数的英语文本向量模型,具有 8,192 token 的上下文窗口——是其时代标准 512 token 限制的 16 倍。它基于带有对称双向 ALiBi(Attention with Linear Biases)的 BERT-small 骨干构建,是首个能原生处理长文档而无需截断或分块的开源 Jina 向量模型。它生成 768 维向量,在不需要 v3/v5 多语言或长上下文功能的纯英语检索中仍是可靠的选择。
方法
该架构将 BERT-small Transformer(12 层、12 个注意力头、768 隐藏维度)与对称双向 ALiBi 位置编码相结合。ALiBi 用线性衰减的注意力偏置取代学习的位置编码,使模型能够远超其 512 token 训练长度、外推至 8,192 token 而不损失性能。训练遵循两阶段流程:先在 C4 上预训练,然后在 Jina 精选的 40 多个专业句对数据集(含困难负样本挖掘)上微调。对称双向注意力确保每个 token 同时关注前文和后文,产生捕捉句子全局语义的表示。对所有 token 表示做平均池化,产生最终的 768 维向量。
性能
发布时,该模型在多个 MTEB 英语子任务上超过 OpenAI 的 text-embedding-ada-002:分类(73.45% vs 70.93%)、重排序(85.38% vs 84.89%)、检索(56.98% vs 56.32%)和摘要(31.6% vs 30.8%)。其 8,192 token 上下文是相对于限制在 512–2,048 token 的竞争模型的显著优势,可实现无需分块的文档级检索。紧凑的 307MB 占用使其可在消费级 GPU 上部署。2026 年,jina-embeddings-v5-text-small(677M 参数、32K 上下文、任务特定 LoRA 适配器)在大多数生产工作负载中超过它,但它对轻量级纯英语流水线仍有意义。
最佳实践
当 8K 上下文窗口足够且不需要多语言或任务特定适配器时,使用此模型进行纯英语检索。对于超过 8,192 token 的文档,在嵌入前应用语义分块。该模型可与主要向量数据库(Qdrant、Weaviate、MongoDB Atlas、Milvus)和 RAG 框架(LangChain、LlamaIndex、Haystack)集成。对于需要多语言支持、32K 上下文或任务特定优化的新项目,请优先使用 jina-embeddings-v5-text-small。生产吞吐量建议使用支持 CUDA 的 GPU;CPU 推理可行但明显更慢。










