I/O 图

文本

jina-embeddings-v2-base-en

向量

帕累托前沿
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxl参数量(对数)nDCG@10
本模型
在前沿上
Jina AI
其他
MTEB English · retrieval
49.05
参数量
137M
按分数的排名
17 / 39
帕累托前沿
在前沿之后
取值分布
AUC 0.8376
语料
翻译对
文档检索
0.8500.600.700.800.90
相关26.9%
困难负例2.7%
无关1.1%
推荐阈值
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
均衡 · 0.762
AUC
0.8376
噪声上限
0.893
召回悬崖
0.691
测量样本对
119 / 11k
向量分量
-0.14-0.000.14
σ 0.0361 · 183k 个数值
向量几何
0768
各维度均值,悬停查看区间
噪声下限
0.751
有效维度
59 / 768
选择要比较的模型
论文 (1)

概述

jina-embeddings-v2-base-en 是一个 137M 参数的英语文本向量模型,具有 8,192 token 的上下文窗口——是其时代标准 512 token 限制的 16 倍。它基于带有对称双向 ALiBi(Attention with Linear Biases)的 BERT-small 骨干构建,是首个能原生处理长文档而无需截断或分块的开源 Jina 向量模型。它生成 768 维向量,在不需要 v3/v5 多语言或长上下文功能的纯英语检索中仍是可靠的选择。

方法

该架构将 BERT-small Transformer(12 层、12 个注意力头、768 隐藏维度)与对称双向 ALiBi 位置编码相结合。ALiBi 用线性衰减的注意力偏置取代学习的位置编码,使模型能够远超其 512 token 训练长度、外推至 8,192 token 而不损失性能。训练遵循两阶段流程:先在 C4 上预训练,然后在 Jina 精选的 40 多个专业句对数据集(含困难负样本挖掘)上微调。对称双向注意力确保每个 token 同时关注前文和后文,产生捕捉句子全局语义的表示。对所有 token 表示做平均池化,产生最终的 768 维向量。

性能

发布时,该模型在多个 MTEB 英语子任务上超过 OpenAI 的 text-embedding-ada-002:分类(73.45% vs 70.93%)、重排序(85.38% vs 84.89%)、检索(56.98% vs 56.32%)和摘要(31.6% vs 30.8%)。其 8,192 token 上下文是相对于限制在 512–2,048 token 的竞争模型的显著优势,可实现无需分块的文档级检索。紧凑的 307MB 占用使其可在消费级 GPU 上部署。2026 年,jina-embeddings-v5-text-small677M 参数、32K 上下文、任务特定 LoRA 适配器)在大多数生产工作负载中超过它,但它对轻量级纯英语流水线仍有意义。

最佳实践

当 8K 上下文窗口足够且不需要多语言或任务特定适配器时,使用此模型进行纯英语检索。对于超过 8,192 token 的文档,在嵌入前应用语义分块。该模型可与主要向量数据库(Qdrant、Weaviate、MongoDB Atlas、Milvus)和 RAG 框架(LangChain、LlamaIndex、Haystack)集成。对于需要多语言支持、32K 上下文或任务特定优化的新项目,请优先使用 jina-embeddings-v5-text-small。生产吞吐量建议使用支持 CUDA 的 GPU;CPU 推理可行但明显更慢。

提及此模型的博客