I/O 圖
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
選擇要比較的模型
論文 (1)
概述
Jina Embedding B v1 是一款專用的文本向量模型,可將英文文本轉換為高維數值表示並保留語義資訊。它滿足了生產環境對高效、精準文本向量的迫切需求,尤其適合需要在計算效率與向量品質之間取得平衡的團隊。該模型以 1.1 億參數生成 768 維向量,無需大量算力即可支撐語義搜尋、文件聚類或內容推薦系統的落地。
方法
該模型採用基於 T5 編碼器的架構,配合均值池化生成定長表示。訓練資料為精心構建的 Linnaeus-Clean 資料集,從最初的 16 億對句子中篩選出 3.85 億對高品質句對。訓練分兩個階段:第一階段在文本對上用 InfoNCE 損失做對比學習;第二階段引入三元組訓練,進一步提升模型區分相似與不相似內容的能力。這套創新的訓練方法,加上語言檢測、一致性校驗等嚴格的資料過濾,讓模型能夠有效捕捉細微的語義關聯。
效能
在實際評估中,Jina Embedding B v1 表現不俗,尤其是在語義文字相似度任務上。它在 STS12 上以 0.751 的成績達到業界領先水平,超過 all-mpnet-base-v2、all-minilm-l6-v2 等成熟模型。它在各類基準上均有穩定發揮,推理耗時也控制得當。不過請注意,該模型專為英文內容最佳化,在多語言或程式碼類任務上可能表現欠佳。目前它已由 jina-embeddings-v2-base-en 和 jina-embeddings-v3 接替,後兩者在更廣泛的場景中表現更強。
最佳實踐
要獲得最佳部署效果,模型需要支援 CUDA 的 GPU,不過體積適中,在普通硬體上也能高效推理。它支援最長 512 詞元的輸入序列,特別適合對向量生成的穩定性和可靠性要求較高的生產環境。該模型在英文內容上表現最佳,非常適合語義搜尋、文件相似度比對和內容推薦等場景。新專案建議改用更新的 v2 或 v3 版本,它們效能更好、語言覆蓋更廣。若任務需要多語言理解,或涉及通用英文文字之外的專業領域知識,則不建議使用本模型。
