I/O 圖

文字

jina-embeddings-v2-base-en

向量

帕累託前緣
30M100M300M1B3.0B10B204060all-MiniLM-L6-v2e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxl參數量(對數)nDCG@10
本模型
在前緣上
Jina AI
其他
MTEB English · retrieval
49.05
參數量
137M
按分數的排名
17 / 39
帕累託前緣
在前緣之後
取值分佈
AUC 0.8376
語料
翻譯對
文件檢索
0.8500.600.700.800.90
相關26.9%
困難負例2.7%
無關1.1%
推薦閾值
FPR 0.1 · 0.793
FPR 0.01 · 0.850
FPR 0.001 · 0.894
FPR 0.0001 · 0.914
均衡 · 0.762
AUC
0.8376
噪聲上限
0.893
召回懸崖
0.691
測量樣本對
119 / 11k
向量分量
-0.14-0.000.14
σ 0.0361 · 183k 個數值
向量幾何
0768
各維度均值,懸停檢視區間
噪聲下限
0.751
有效維度
59 / 768
選擇要比較的模型
論文 (1)

概述

jina-embeddings-v2-base-en 是一個 137M 參數的英文文字向量模型,具有 8,192 token 的上下文視窗——是其時代標準 512 token 限制的 16 倍。它基於帶有對稱雙向 ALiBi(Attention with Linear Biases)的 BERT-small 骨幹構建,是首個能原生處理長文件而無需截斷或分塊的開源 Jina 向量模型。它生成 768 維向量,在不需要 v3/v5 多語言或長上下文功能的純英文檢索中仍是可靠的選擇。

方法

該架構將 BERT-small Transformer(12 層、12 個注意力頭、768 隱藏維度)與對稱雙向 ALiBi 位置編碼相結合。ALiBi 用線性衰減的注意力偏置取代學習的位置編碼,使模型能夠遠超其 512 token 訓練長度、外推至 8,192 token 而不損失性能。訓練遵循兩階段流程:先在 C4 上預訓練,然後在 Jina 精選的 40 多個專業句對資料集(含困難負樣本挖掘)上微調。對稱雙向注意力確保每個 token 同時關注前文和後文,產生捕捉句子全域語意的表示。對所有 token 表示做平均池化,產生最終的 768 維向量。

效能

發布時,該模型在多個 MTEB 英文子任務上超過 OpenAI 的 text-embedding-ada-002:分類(73.45% vs 70.93%)、重新排序(85.38% vs 84.89%)、檢索(56.98% vs 56.32%)和摘要(31.6% vs 30.8%)。其 8,192 token 上下文是相對於限制在 512–2,048 token 的競爭模型的顯著優勢,可實現無需分塊的文件級檢索。精簡的 307MB 佔用使其可在消費級 GPU 上部署。2026 年,jina-embeddings-v5-text-small(677M 參數、32K 上下文、任務特定 LoRA 適配器)在大多數生產工作負載中超過它,但它對輕量級純英文流水線仍有意義。

最佳實踐

當 8K 上下文視窗足夠且不需要多語言或任務特定適配器時,使用此模型進行純英文檢索。對於超過 8,192 token 的文件,在嵌入前應用語意分塊。該模型可與主要向量資料庫(Qdrant、Weaviate、MongoDB Atlas、Milvus)和 RAG 框架(LangChain、LlamaIndex、Haystack)整合。對於需要多語言支援、32K 上下文或任務特定最佳化的新專案,請優先使用 jina-embeddings-v5-text-small。生產吞吐量建議使用支援 CUDA 的 GPU;CPU 推論可行但明顯較慢。

提及此模型的部落格