Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
warning
此模型已被更新的模型取代。
向量模型
Apache 2.0 许可证

jina-embedding-b-en-v1

Jina 向量模型的初代版本,元老级模型。
许可证
Apache-2.0
发布日期
calendar_month
2023-06-17
输入
abc
文本
arrow_forward
输出
more_horiz
向量
模型详情
参数: 110M
输入词元长度: 512
输出维度: 768
底座模型 help_outline
open_in_new
T5-Base Encoder
已训练语言 help_outline
1 种语言
相关模型
link
jina-embeddings-v2-base-en
link
jina-embeddings-v3
可通过以下方式获取
Hugging Face
物理隔离
I/O 图

文本

jina-embedding-b-en-v1

向量

Pareto fronthelp_outline
MTEB English · retrieval
MTEB English · sts
chevron_leftchevron_right
30M100M300M1B3.0B10B204060e5-base-v2e5-mistral-7b-instructEmbeddingGemma-300MEVA-CLIP ViT-B/16gtr-t5-basegtr-t5-xlgtr-t5-xxljina-clip-v1jina-clip-v2jina-embedding-l-en-v1jina-embedding-s-en-v1jina-embeddings-v2-base…jina-embeddings-v2-smal…jina-embeddings-v3jina-embeddings-v4jina-embeddings-v5-text…jina-embeddings-v5-text…LongCLIP ViT-B/16nllb-siglip-largeOpenAI CLIP ViT-B/16Qwen3-Embedding-0.6BQwen3-Embedding-4Bsentence-t5-basesentence-t5-largesentence-t5-xlsentence-t5-xxljina-embedding-b-en-v1Parameters (log)nDCG@10
This model
On the front
Jina AI
Other
MTEB English · retrieval
44.03
Parameters
110M
Rank by score
28 / 39
Pareto front
Behind it
选择要比较的模型
论文 (1)
EMNLP 2023
七月 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models

概述

Jina Embedding B v1 是一款专用的文本向量模型,可将英文文本转换为高维数值表示并保留语义信息。它满足了生产环境对高效、精准文本向量的迫切需求,尤其适合需要在计算效率与向量质量之间取得平衡的团队。该模型以 1.1 亿参数生成 768 维向量,无需大量算力即可支撑语义搜索、文档聚类或内容推荐系统的落地。

方法

该模型采用基于 T5 编码器的架构,配合均值池化生成定长表示。训练数据为精心构建的 Linnaeus-Clean 数据集,从最初的 16 亿对句子中筛选出 3.85 亿对高质量句对。训练分两个阶段:第一阶段在文本对上用 InfoNCE 损失做对比学习;第二阶段引入三元组训练,进一步提升模型区分相似与不相似内容的能力。这套创新的训练方法,加上语言检测、一致性校验等严格的数据过滤,让模型能够有效捕捉细微的语义关联。

性能

在实际评估中,Jina Embedding B v1 表现不俗,尤其是在语义文本相似度任务上。它在 STS12 上以 0.751 的成绩达到业界领先水平,超过 all-mpnet-base-v2、all-minilm-l6-v2 等成熟模型。它在各类基准上均有稳定发挥,推理耗时也控制得当。不过请注意,该模型专为英文内容优化,在多语言或代码类任务上可能表现欠佳。目前它已由 jina-embeddings-v2-base-en 和 jina-embeddings-v3 接替,后两者在更广泛的场景中表现更强。

最佳实践

要获得最佳部署效果,模型需要支持 CUDA 的 GPU,不过体积适中,在普通硬件上也能高效推理。它支持最长 512 词元的输入序列,特别适合对向量生成的稳定性和可靠性要求较高的生产环境。该模型在英文内容上表现最佳,非常适合语义搜索、文档相似度比对和内容推荐等场景。新项目建议改用更新的 v2 或 v3 版本,它们性能更好、语言覆盖更广。若任务需要多语言理解,或涉及通用英文文本之外的专业领域知识,则不建议使用本模型。
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。