I/O 圖

文字

jina-embedding-b-en-v1

向量

帕累託前緣
30M100M300M1B3.0B657075808590bge-m3e5-base-v2EmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-largegtr-t5-xlgtr-t5-xxljina-clip-v2jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…KaLM-mini-v2.5LongCLIP ViT-B/16multilingual-e5-basemultilingual-e5-large-i…nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-4Bsentence-t5-basesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1參數量(對數)Spearman
本模型
在前緣上
Jina AI
其他
MTEB English · sts
79.93
參數量
110M
按分數的排名
28 / 39
帕累託前緣
在前緣之後
選擇要比較的模型
論文 (1)

概述

jina-embedding-b-en-v1 是 Jina AI 首個公開發布的文字向量模型:一個 110M 參數的雙向編碼器,將英文文字映射到 768 維向量。它為語意搜尋、相似度比較和內容推薦而設計,彼時 512 token 上下文是產業標準,從而確立了 Jina 進入開源向量模型領域的地位。該模型現已成為遺留模型,被支援 8K+ token 上下文和多語輸入的 v2 和 v3 系列取代。

方法

該模型使用 T5-編碼器架構搭配平均池化,產生固定長度的 768 維表示。訓練遵循 Linnaeus-Clean 資料集上的兩階段對比方案(從 16 億候選中過濾出 385M 句對):第一階段用正例文字對進行 InfoNCE 損失以學習語意對齊;第二階段用三元組損失以銳化相似但語意不同文字之間的判別。一個關鍵設計決策是平均池化策略,它對 token 級表示取平均,產生捕捉句子全域語意的單個向量。512 token 的上下文視窗在當時是標準,但限制了模型在長文件應用中的實用性。

效能

在 STS12 上,模型取得 0.751 的相關係數,發布時超過 all-mpnet-base-v2 和 all-minilm-l6-v2。它在標準英文句子向量任務上表現出色,同時保持適合生產環境的快速推理時間。其 512 token 上下文視窗和僅英文的定位使其不適合到 2025 年成為標準的長文件和多語工作負載。該模型已被 jina-embeddings-v2-base-en(8K 上下文、雙向 ALiBi)和 jina-embeddings-v3(570M 參數、89 種語言、任務特定 LoRA 適配器)取代。

最佳實踐

該模型為遺留模型,不應用於新專案。若從 jina-embedding-b-en-v1 遷移,請升級到 jina-embeddings-v5-text-small 以應對當前工作負載——它支援 32K token 上下文、89 種語言和任務特定 LoRA 適配器。對於程式碼特定的向量需求,請使用 jina-code-embeddings-1.5b。該模型需要支援 CUDA 的硬體以獲得最佳性能,接受最多 512 token 的輸入。它不適合多語內容、長文件或程式碼為中心的應用。