Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 轉成 Markdown,為大模型提供更好的事實依據。
向量模型
多模態多語言向量模型。
重排模型
讓搜尋相關性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生執行 Jina 模型。
MCP
terminal
命令列
article
llms.txt
smart_toy
智慧體
data_object
Schema
menu_book
文件
登入
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 許可證

jina-embedding-b-en-v1

Jina 向量模型的初代版本,元老級模型。
許可證
Apache-2.0
釋出日期
calendar_month
2023-06-17
輸入
abc
文字
arrow_forward
輸出
more_horiz
向量
模型詳情
引數: 110M
輸入詞元長度: 512
輸出維度: 768
底座模型 help_outline
open_in_new
T5-Base Encoder
已訓練語言 help_outline
1 種語言
相關模型
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
可透過以下方式獲取
Hugging Face
物理隔離
I/O 圖

文字

jina-embedding-b-en-v1

向量

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
選擇要比較的模型
論文 (1)
EMNLP 2023
七月 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

概述

Jina Embedding B v1 是一款專用的文本向量模型,可將英文文本轉換為高維數值表示並保留語義資訊。它滿足了生產環境對高效、精準文本向量的迫切需求,尤其適合需要在計算效率與向量品質之間取得平衡的團隊。該模型以 1.1 億參數生成 768 維向量,無需大量算力即可支撐語義搜尋、文件聚類或內容推薦系統的落地。

方法

該模型採用基於 T5 編碼器的架構,配合均值池化生成定長表示。訓練資料為精心構建的 Linnaeus-Clean 資料集,從最初的 16 億對句子中篩選出 3.85 億對高品質句對。訓練分兩個階段:第一階段在文本對上用 InfoNCE 損失做對比學習;第二階段引入三元組訓練,進一步提升模型區分相似與不相似內容的能力。這套創新的訓練方法,加上語言檢測、一致性校驗等嚴格的資料過濾,讓模型能夠有效捕捉細微的語義關聯。

效能

在實際評估中,Jina Embedding B v1 表現不俗,尤其是在語義文字相似度任務上。它在 STS12 上以 0.751 的成績達到業界領先水平,超過 all-mpnet-base-v2、all-minilm-l6-v2 等成熟模型。它在各類基準上均有穩定發揮,推理耗時也控制得當。不過請注意,該模型專為英文內容最佳化,在多語言或程式碼類任務上可能表現欠佳。目前它已由 jina-embeddings-v2-base-en 和 jina-embeddings-v3 接替,後兩者在更廣泛的場景中表現更強。

最佳實踐

要獲得最佳部署效果,模型需要支援 CUDA 的 GPU,不過體積適中,在普通硬體上也能高效推理。它支援最長 512 詞元的輸入序列,特別適合對向量生成的穩定性和可靠性要求較高的生產環境。該模型在英文內容上表現最佳,非常適合語義搜尋、文件相似度比對和內容推薦等場景。新專案建議改用更新的 v2 或 v3 版本,它們效能更好、語言覆蓋更廣。若任務需要多語言理解,或涉及通用英文文字之外的專業領域知識,則不建議使用本模型。
當前語言 / 主題
搜尋底座
Reader
向量模型
重排模型
獲取 Jina API 金鑰
速率限制
關於我們
新聞
下載 Jina 徽標
open_in_new
下載 Elastic 徽標
open_in_new
API 狀態
Elastic © 2026.安全條款及條件隱私管理 Cookie請勿出售或分享我的個人資訊
本網站及其所有相關內容、軟體、產品和服務僅供專業人士使用。不面向任何消費者,也不鼓勵任何消費者使用。