概述
jina-embeddings-v2-base-en 是一個 137M 參數的英文文字向量模型,具有 8,192 token 的上下文視窗——是其時代標準 512 token 限制的 16 倍。它基於帶有對稱雙向 ALiBi(Attention with Linear Biases)的 BERT-small 骨幹構建,是首個能原生處理長文件而無需截斷或分塊的開源 Jina 向量模型。它生成 768 維向量,在不需要 v3/v5 多語言或長上下文功能的純英文檢索中仍是可靠的選擇。
方法
該架構將 BERT-small Transformer(12 層、12 個注意力頭、768 隱藏維度)與對稱雙向 ALiBi 位置編碼相結合。ALiBi 用線性衰減的注意力偏置取代學習的位置編碼,使模型能夠遠超其 512 token 訓練長度、外推至 8,192 token 而不損失性能。訓練遵循兩階段流程:先在 C4 上預訓練,然後在 Jina 精選的 40 多個專業句對資料集(含困難負樣本挖掘)上微調。對稱雙向注意力確保每個 token 同時關注前文和後文,產生捕捉句子全域語意的表示。對所有 token 表示做平均池化,產生最終的 768 維向量。
效能
發布時,該模型在多個 MTEB 英文子任務上超過 OpenAI 的 text-embedding-ada-002:分類(73.45% vs 70.93%)、重新排序(85.38% vs 84.89%)、檢索(56.98% vs 56.32%)和摘要(31.6% vs 30.8%)。其 8,192 token 上下文是相對於限制在 512–2,048 token 的競爭模型的顯著優勢,可實現無需分塊的文件級檢索。精簡的 307MB 佔用使其可在消費級 GPU 上部署。2026 年,jina-embeddings-v5-text-small(677M 參數、32K 上下文、任務特定 LoRA 適配器)在大多數生產工作負載中超過它,但它對輕量級純英文流水線仍有意義。
最佳實踐
當 8K 上下文視窗足夠且不需要多語言或任務特定適配器時,使用此模型進行純英文檢索。對於超過 8,192 token 的文件,在嵌入前應用語意分塊。該模型可與主要向量資料庫(Qdrant、Weaviate、MongoDB Atlas、Milvus)和 RAG 框架(LangChain、LlamaIndex、Haystack)整合。對於需要多語言支援、32K 上下文或任務特定最佳化的新專案,請優先使用 jina-embeddings-v5-text-small。生產吞吐量建議使用支援 CUDA 的 GPU;CPU 推論可行但明顯較慢。










