Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP terminal命令行articlellms.txtsmart_toy智能体data_objectSchemamenu_book文档



登录
login

联系销售

与 Jina AI 一起拓展您的业务。

nights_stay 销售团队暂时离开,将在 3 小时后返回。

两种购买方式

订阅我们的 API,或通过云服务商购买。
radio_button_unchecked
cloud
携手 3 家云服务商
在用 AWS 或 Azure?您可以直接在公司的云平台上部署我们的模型,并通过云服务商账户统一结算。
AWS SageMaker
Embeddings
Reranker
Microsoft Azure
Embeddings
Reranker
Google Cloud
Embeddings
radio_button_checked
使用 Jina Search Foundation API
访问我们全部产品最简单的方式,按需充值词元。
为此 API 密钥充值更多词元
根据您所在的地区,扣款币种可能为美元、欧元或其他货币,并可能需要缴纳税费。
请输入正确的 API 密钥以充值
了解速率限制
速率限制指每个 IP 地址/API 密钥每分钟可发起的最大请求数(RPM)。各产品和各档位的速率限制详见下表。
keyboard_arrow_down
速率限制
速率限制按以下维度统计:RPM(每分钟请求数)和 TPM(每分钟词元数)。限制按 IP/API 密钥分别计算,RPM 或 TPM 任一先达到阈值即触发限制。若您在请求头中提供了 API 密钥,我们将按密钥而非 IP 地址统计速率限制。
产品API 端点描述arrow_upward无 API 密钥key_off免费 API 密钥key付费 API 密钥key高级 API 密钥key平均延迟词元用量计算方式允许的请求
Reader APIhttps://r.jina.ai将 URL 转换为大模型友好文本20 RPM500 RPM500 RPMtrending_up5000 RPM7.9s按输出响应中的词元数计算。GET/POST
Reader APIhttps://s.jina.ai搜索网络并将结果转换为大模型友好文本block100 RPM100 RPMtrending_up1000 RPM2.5s每次请求消耗固定数量的词元,起步 10000 个词元GET/POST
Reranker APIhttps://api.jina.ai/v1/rerank按查询对文档重排block100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
取决于输入大小
help
按输入请求中的词元数计算。POST
向量模型 APIhttps://api.jina.ai/v1/embeddings将文本/图片转为定长向量block100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
取决于输入大小
help
按输入请求中的词元数计算。POST
分类器 APIhttps://api.jina.ai/v1/train使用带标签的样本训练分类器block25 RPM & 25,000 TPM125 RPM & 500,000 TPM1,250 RPM & 12,000,000 TPM
ssid_chart
取决于输入大小
词元计数为:输入词元 × 迭代次数POST
分类器 API (少样本)https://api.jina.ai/v1/classify使用经过训练的少样本分类器对输入进行分类block25 RPM & 25,000 TPM125 RPM & 500,000 TPM1,250 RPM & 12,000,000 TPM
ssid_chart
取决于输入大小
词元计数为:输入词元POST
分类器 API (零样本)https://api.jina.ai/v1/classify使用零样本分类对输入进行分类block25 RPM & 25,000 TPM125 RPM & 500,000 TPM1,250 RPM & 12,000,000 TPM
ssid_chart
取决于输入大小
词元计数为:输入词元 + 标签词元POST
Segmenter APIhttps://api.jina.ai/v1/segment对长文本进行分词分句20 RPM200 RPM200 RPM1,000 RPM0.3s不计入词元用量。GET/POST
DeepSearchhttps://deepsearch.jina.ai/v1/chat/completions通过推理、搜索与迭代找到最佳答案block50 RPM50 RPM500 RPM56.7s统计整个流程消耗的词元总数。POST

常见问题

Jina AI × Elastic

handshake
Jina 品牌会保留吗?
keyboard_arrow_down
会。Jina 正在转型为一个模型品牌,就像 Qwen 之于阿里巴巴、GPT 之于 OpenAI、Kimi 之于月之暗面。我们会逐步把公司的法律主体从 Jina AI 迁移到 Elastic,让 Jina AI 作为品牌专注于搜索基座模型。
handshake
Jina AI 今后会专注于什么?
keyboard_arrow_down
向量模型、重排模型和小型语言模型,让搜索更进一步。我们的使命尚未完成——我们从不讳言自己的目标:成为领先的搜索模型提供商。
handshake
API 和云市场的产品还会继续吗?
keyboard_arrow_down
是的。Reader API、Embedding API 和 Reranker API 将继续开发和维护。我们发布的每个模型都会同步发布到云市场平台。您可以像以前一样继续使用我们的 API 服务。唯一的例外是我们无法为受美国出口管制的实体或国家/地区提供服务。
handshake
你们还会在 Hugging Face 上发布开放权重模型吗?
keyboard_arrow_down
是的。在 Elastic,Jina 将继续推进搜索底座模型的前沿发展,我们也会继续发布开放权重模型。
handshake
这些开放模型会以哪种许可协议发布?
keyboard_arrow_down
除非情况发生变化(可能性不大),我们会继续以 CC-BY-NC 4.0 协议发布。
handshake
你们还会继续发表研究论文吗?
keyboard_arrow_down
是的。我们发布的每个模型都会有严谨的论文作为支撑,我们也会继续向 ICLR、EMNLP、SIGIR、NeurIPS 和 ICML 等顶级会议投稿。
handshake
我目前还不是 Jina 或 Elastic 的客户,但我想要使用 Reader API、模型 API 或云市场镜像。我应该怎么做?
keyboard_arrow_down
只需像以前一样,通过我们的网站或相关的云市场注册并付款即可。
handshake
我已经是 Elastic 的付费客户,现在想使用 Reader API、模型 API 或云市场镜像。我应该怎么做?
keyboard_arrow_down
目前,我们的产品尚未纳入 Elastic 的产品库 (SKU),因此您仍需通过我们的网站付费才能使用这些服务。不久的将来,Jina 模型将可通过 Elastic 推理服务使用。
handshake
我是 Elastic 的付费客户,想把 Jina 的向量模型和重排模型私有化部署用于商业用途,而不是通过 API 或云市场。我该怎么做?
keyboard_arrow_down
请联系您的 Elastic 销售代表或现场解决方案工程师,他们会与我们协调,确认商业私有化部署是否包含在您的 Elastic 许可范围内。
handshake
我不是 Elastic 的客户,想把 Jina 的向量模型和重排模型私有化部署用于商业用途,而不是通过 API 或云市场。我该怎么做?
keyboard_arrow_down
我们目前正在与 Elastic 整合,后续路径很快会更清晰。现阶段我们还无法为这些模型单独签发商业授权协议。
handshake
我以中国主体身份购买你们的服务,可以开具中文发票吗?
keyboard_arrow_down
我们没有中国法律实体,无法开具中文发票。发票由我们位于德国的总部 Jina AI GmbH 开具。
handshake
我想和 Jina AI 签订合同,该怎么做?
keyboard_arrow_down
合同制一直只占 Jina AI 商业模式中很小的一部分,绝大多数客户采用按量付费的自助方式。在与 Elastic 整合期间,我们暂不签订新合同。
handshake
我是 Elastic 的付费客户,想了解使用向量模型和重排模型的最佳实践,或者对 Jina AI 的进展感兴趣。我该怎么做?
keyboard_arrow_down
请联系您的 Elastic 销售代表,我们可以安排您、Jina AI 团队和 Elastic 进行会面讨论。

如何获取我的 API 密钥?

video_not_supported

速率限制是多少?

速率限制
速率限制按以下维度统计:RPM(每分钟请求数)和 TPM(每分钟词元数)。限制按 IP/API 密钥分别计算,RPM 或 TPM 任一先达到阈值即触发限制。若您在请求头中提供了 API 密钥,我们将按密钥而非 IP 地址统计速率限制。
产品API 端点描述arrow_upward无 API 密钥key_off免费 API 密钥key付费 API 密钥key高级 API 密钥key平均延迟词元用量计算方式允许的请求
Reader APIhttps://r.jina.ai将 URL 转换为大模型友好文本20 RPM500 RPM500 RPMtrending_up5000 RPM7.9s按输出响应中的词元数计算。GET/POST
Reader APIhttps://s.jina.ai搜索网络并将结果转换为大模型友好文本block100 RPM100 RPMtrending_up1000 RPM2.5s每次请求消耗固定数量的词元,起步 10000 个词元GET/POST
Reranker APIhttps://api.jina.ai/v1/rerank按查询对文档重排block100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
取决于输入大小
help
按输入请求中的词元数计算。POST
向量模型 APIhttps://api.jina.ai/v1/embeddings将文本/图片转为定长向量block100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
取决于输入大小
help
按输入请求中的词元数计算。POST
分类器 APIhttps://api.jina.ai/v1/train使用带标签的样本训练分类器block25 RPM & 25,000 TPM125 RPM & 500,000 TPM1,250 RPM & 12,000,000 TPM
ssid_chart
取决于输入大小
词元计数为:输入词元 × 迭代次数POST
分类器 API (少样本)https://api.jina.ai/v1/classify使用经过训练的少样本分类器对输入进行分类block25 RPM & 25,000 TPM125 RPM & 500,000 TPM1,250 RPM & 12,000,000 TPM
ssid_chart
取决于输入大小
词元计数为:输入词元POST
分类器 API (零样本)https://api.jina.ai/v1/classify使用零样本分类对输入进行分类block25 RPM & 25,000 TPM125 RPM & 500,000 TPM1,250 RPM & 12,000,000 TPM
ssid_chart
取决于输入大小
词元计数为:输入词元 + 标签词元POST
Segmenter APIhttps://api.jina.ai/v1/segment对长文本进行分词分句20 RPM200 RPM200 RPM1,000 RPM0.3s不计入词元用量。GET/POST
DeepSearchhttps://deepsearch.jina.ai/v1/chat/completions通过推理、搜索与迭代找到最佳答案block50 RPM50 RPM500 RPM56.7s统计整个流程消耗的词元总数。POST

我需要商业许可证吗?

CC BY-NC 许可自检

play_arrow
您使用的是我们的官方 API,或 Azure、AWS、GCP 上的官方镜像吗?
play_arrow
是
没有任何限制。只需通过我们的网站或云市场注册并付费即可。
play_arrow
否
play_arrow
您是 Elastic 的付费客户吗?
play_arrow
是
您的 Elastic 许可证可能已包含商业用途。如有疑问,请联系您的 Elastic 销售代表。
联系销售
play_arrow
否
我们目前无法签发独立的商业许可协议。请联系 Elastic 销售部门了解更多信息。
联系销售

其他问题

Reader 常见问题
使用 Reader API 需要多少费用?
keyboard_arrow_down
Reader API 基础用法免费,只需在 URL 前加上「https://r.jina.ai/」即可。如需更高的速率限制,可提供 API 密钥,届时会按内容长度扣除词元。速率限制详情请参见问题 16。
Reader API 是怎么工作的?
keyboard_arrow_down
Reader API 通过代理抓取任意 URL,在浏览器中渲染页面,从而提取出高质量的正文内容。
Reader API 开源吗?
keyboard_arrow_down
Reader API 的代码可在 Jina AI 的 GitHub 代码库中找到。请注意,ReaderLM-v2 模型采用 CC-BY-NC 4.0 协议,仅限非商业用途,并非开源许可。
Reader API 的典型延迟是多少?
keyboard_arrow_down
Reader API 通常在 2 秒内处理完 URL 并返回内容,复杂或动态页面可能需要更长时间。
我为什么要用 Reader API,而不是自己抓页面?
keyboard_arrow_down
自己抓取既麻烦又不稳定,遇到复杂或动态页面尤其如此。Reader API 直接给出干净、可靠、适合大模型阅读的文本。
Reader API 支持多种语言吗?
keyboard_arrow_down
Reader API 按 URL 原本的语言返回内容,不提供翻译服务。
Reader API 是否遵循网站访问控制?
keyboard_arrow_down
遵循。Reader 作为标准网页客户端运行,会遵循网站的访问控制。如果网站拒绝了请求,我们就尊重这一结果。您有责任确保使用 Reader 时符合所访问网站的条款,且不侵犯第三方知识产权。
Reader API 能提取 PDF 文件的内容吗?
keyboard_arrow_down
可以,Reader API 原生支持从 PDF 文件中提取内容。
Reader API 能处理网页中的媒体内容吗?
keyboard_arrow_down
可以,Reader 支持通过 x-with-generated-alt 请求头为网页图片生成描述。它会给缺少 alt 标签的图片补上描述性文字,让大模型也能理解视觉内容。视频摘要功能计划在后续版本中推出。
可以用 Reader API 处理本地 HTML 文件吗?
keyboard_arrow_down
不可以,Reader API 只能处理可公开访问的 URL。
Reader API 会缓存内容吗?
keyboard_arrow_down
如果您在 5 分钟内重复请求同一个 URL,Reader API 会返回缓存内容。
可以用 Reader API 访问需要登录才能看的内容吗?
keyboard_arrow_down
很遗憾,不可以。
可以用 Reader API 访问 arXiv 上的 PDF 吗?
keyboard_arrow_down
可以,您既能用 Reader 的原生 PDF 支持(https://r.jina.ai/https://arxiv.org/pdf/2310.19923v4),也能改用 arXiv 的 HTML 版本(https://r.jina.ai/https://arxiv.org/html/2310.19923v4)
Reader 的图片描述功能是怎么工作的?
keyboard_arrow_down
Reader 会为目标 URL 上的所有图片生成描述,并以 `Image [idx]: [caption]` 的形式补充为 alt 标签(前提是图片原本没有)。这样下游大模型就能在推理、摘要等环节用上这些图片。
Reader 的可扩展性如何?可以用在生产环境吗?
keyboard_arrow_down
Reader API 在设计上具备很强的扩展性,会根据实时流量自动扩容,目前最大并发请求数约为 4000。它是 Jina AI 的核心产品之一,我们一直在积极维护,请放心用于生产环境。
Reader API 的速率限制是多少?
keyboard_arrow_down
最新的速率限制信息见下表。请注意,我们仍在持续优化 Reader API 的速率限制和性能,该表会随之更新。
speed速率限制
什么是 Reader-LM?该怎么用?
keyboard_arrow_down
ReaderLM-v2 是我们最新的小型语言模型(SLM),用于把原始 HTML 转成干净的 Markdown 或 JSON。相比 v1,质量提升 3 倍,还能按 JSON schema 或自然语言指令抽取结构化数据。您可以在 Reader API 中加上 x-respond-with: readerlm-v2 请求头直接调用,也可以从云市场(AWS、Azure、GCP)部署。
launchAWS SageMakerlaunchGoogle CloudlaunchMicrosoft Azure
如何从网页中提取结构化数据?
keyboard_arrow_down
加上 x-json-schema 请求头并给出 JSON schema 定义,或者加上 x-instruction 请求头并给出自然语言指令。这两种方式都由 ReaderLM-v2 支撑,可以把任意网页中的价格、标题、日期等字段抽取成结构化 JSON。
Reader 是否会主动绕过网站的反机器人保护?
keyboard_arrow_down
不会。Reader 不会主动规避或绕过任何网站的防御机制、反爬系统或访问控制。如果网站把我们的服务识别为机器人并拒绝请求,我们就尊重这一结果。我们作为标准网页客户端运行,不使用任何逃避检测的技术。您仍需自行确保使用 Reader 时尊重第三方知识产权和所访问网站的条款。
从免费 API 密钥升级到付费 API 密钥后,我能访问更多网站吗?
keyboard_arrow_down
不会。从免费套餐升级到付费 API 密钥,并不会让您访问更多网站,也不会绕过任何站点限制。套餐之间的区别主要在速率限制和性能优化:付费密钥的请求吞吐量更高、处理更快,但无法访问那些屏蔽我们服务的网站。
向量模型相关的常见问题
Jina 向量模型是如何训练的?
keyboard_arrow_down
有关我们的训练过程、数据来源和评估的详细信息,请参阅我们在 arXiv 上发布的 jina-embeddings-v3 和 jina-embeddings-v4 技术报告。
launcharXiv
你们的多模态向量模型是什么?
keyboard_arrow_down
jina-embeddings-v4 是我们最新的通用多模态模型(38 亿参数),支持文本和图片,上下文长度 32K,同时支持稠密检索和迟交互检索,在图文混排文档上达到业界领先水平。jina-clip-v2 更为轻量(8.65 亿参数),支持 89 种语言、512x512 图片分辨率和 Matryoshka 表示。两者在文本-文本、文本-图片和图片-图片检索任务上均表现出色。
launcharXiv
你们的模型支持哪些语言?
keyboard_arrow_down
jina-embeddings-v4 和 jina-embeddings-v3 均支持 89 种语言,多语言表现出色。排名前 30 的语言包括:阿拉伯语、孟加拉语、中文、丹麦语、荷兰语、英语、芬兰语、法语、格鲁吉亚语、德语、希腊语、印地语、印尼语、意大利语、日语、韩语、拉脱维亚语、挪威语、波兰语、葡萄牙语、罗马尼亚语、俄语、斯洛伐克语、西班牙语、瑞典语、泰语、土耳其语、乌克兰语、乌尔都语和越南语。jina-clip-v2 同样支持 89 种语言,可用于多模态任务。
launcharXiv
单个句子输入的最大长度是多少?
keyboard_arrow_down
上下文长度因模型而异:jina-embeddings-v4 最多支持 32K 词元,jina-embeddings-v3 和 jina-clip-v2 最多支持 8192 词元。一个词元可以是一个字符,也可以是一个完整的单词。更长的上下文让您能够完整分析长文档,在处理大量文本时也能更准确地理解上下文。
单个请求中最多可以包含多少个句子?
keyboard_arrow_down
单次请求包含的条目数没有硬性上限。API 会在内部按词元数对输入分批,以充分利用 GPU。您可以在一次请求中发送所需数量的文本或图片。
如何把图片传给多模态向量模型?
keyboard_arrow_down
对于 jina-embeddings-v4、jina-clip-v2 和 jina-clip-v1,您可以使用 url 或 bytes,填入 API 请求的 input 字段。使用 url 时,填入待处理图片的地址;使用 bytes 时,把图片编码为 base64 格式。jina-embeddings-v4 还支持直接向量化 PDF 文档,传入 PDF 地址或 base64 编码的 PDF 字节即可。
Jina Embeddings 模型与 OpenAI 和 Cohere 的最新向量模型相比如何?
keyboard_arrow_down
jina-embeddings-v4 是我们最新的旗舰模型,在图文混排文档检索(ViDoRe)和多模态基准测试上均达到业界领先水平。在纯文本任务上,jina-embeddings-v3 于 MTEB 英语和多语言基准上超越 OpenAI 和 Cohere,同时体积更小、效率更高。两个模型都支持 Matryoshka 表示学习(MRL),可在性能损失很小的前提下截断维度(v3 最低可至 32 维,v4 最低可至 128 维)。
如何从 OpenAI 的 text-embedding-3-large 迁移到 Jina Embeddings 模型?
keyboard_arrow_down
迁移非常顺畅,因为我们的 API 端点与 OpenAI text-embedding-3-large 模型的输入和输出 JSON 结构一致。得益于这种兼容性,您在使用 OpenAI 端点时可以直接把模型换成我们的。
使用 jina-clip 和 jina-embeddings 模型时,词元是如何计算的?
keyboard_arrow_down
词元数根据文本长度和图片尺寸计算。请求中的文本按标准方式计数;图片则按以下步骤处理: 1. 图块大小:每张图片会被切分成图块。jina-embeddings-v4 的图块为 28x28 像素,jina-clip-v2 为 512x512 像素,jina-clip-v1 为 224x224 像素。 2. 覆盖:计算覆盖整张图片所需的图块数量。即使图片尺寸无法被图块尺寸整除,不完整的图块也按完整图块计。 3. 图块总数:覆盖图片的图块总数决定费用。例如一张 600x600 像素的图片,在 jina-embeddings-v4 中需要 22x22 个图块(484 个),在 jina-clip-v2 中需要 2x2 个图块(4 个),在 jina-clip-v1 中需要 3x3 个图块(9 个)。 4. 费用计算:jina-embeddings-v4 每个图块计 10 个词元,jina-clip-v2 每个图块计 4000 个词元,jina-clip-v1 每个图块计 1000 个词元。 示例: 以一张 600x600 像素的图片为例: • 使用 jina-embeddings-v4 • 图片被切分为 28x28 像素的图块。 • 所需图块总数为 22(横向)x 22(纵向)= 484 个。 • jina-embeddings-v4 的费用为 484*10 = 4840 个词元。 • 使用 jina-clip-v2 • 图片被切分为 512x512 像素的图块。 • 所需图块总数为 2(横向)x 2(纵向)= 4 个。 • jina-clip-v2 的费用为 4*4000 = 16000 个词元。 • 使用 jina-clip-v1 • 图片被切分为 224x224 像素的图块。 • 所需图块总数为 3(横向)x 3(纵向)= 9 个。 • jina-clip-v1 的费用为 9*1000 = 9000 个词元。
你们有向量化图片或音频的模型吗?
keyboard_arrow_down
是的,jina-embeddings-v4、jina-clip-v2 和 jina-clip-v1 都可以同时向量化图片和文本。支持更多模态的向量模型即将发布!
Jina 向量模型可以用私有数据或公司数据微调吗?
keyboard_arrow_down
如需用特定数据微调我们的模型,请联系我们详谈您的需求。我们乐于探讨如何调整模型来贴合您的场景。
联系我们
您的服务可以在 AWS、Azure 或 GCP 上私有化部署吗?
keyboard_arrow_down
可以,我们的服务已上架 AWS、Azure 和 GCP 市场。如有特殊需求,请通过 sales AT jina.ai 联系我们。
launchAWS SageMakerlaunchGoogle CloudlaunchMicrosoft Azure
task 参数是什么?什么时候该用它?
keyboard_arrow_down
task 参数可在 jina-embeddings-v3 和 jina-embeddings-v4 中激活任务专属的 LoRA 适配器,以获得最佳效果。搜索查询用 retrieval.query,被检索的文档用 retrieval.passage,语义相似度用 text-matching,文本分类用 classification,聚类任务用 separation。
什么是迟交互检索?哪些模型支持?
keyboard_arrow_down
jina-embeddings-v4 通过 output_type 参数同时支持稠密(单向量)检索和迟交互(多向量)检索。迟交互保留了更细粒度的词元级信息,在复杂查询上检索准确率更高。jina-colbert-v2 是专门的迟交互模型。
什么是迟分?什么时候该用它?
keyboard_arrow_down
迟分是这样一种技术:先用长上下文模型对整篇文档做向量化,再从词元级表示中提取各分块的向量。与朴素分块(先分块、再向量化)不同,迟分保留了跨分块的上下文,可提升 RAG 应用的检索效果。在 jina-embeddings-v3 中通过 late_chunking 参数启用。
为什么 API 支持的上下文长度与模型的最大容量不同?
keyboard_arrow_down
我们的部分向量模型在架构上虽能处理更长的上下文,但受推理基础设施的 GPU 显存所限,API 可能会设置更低的上限。处理超长序列需要占用大量显存,因此我们在服务配置上做了权衡,以兼顾大多数场景下的吞吐量、延迟与成本。如需更长的上下文支持,请联系销售团队洽谈专属部署方案。
为什么 jina-embeddings-v4 是免费的,速度又比较慢?
keyboard_arrow_down
jina-embeddings-v4 基于 Qwen2-VL 基座模型构建,而后者以 Qwen 研究许可发布。该许可仅允许研究和非商业用途,因此我们无法把 jina-embeddings-v4 作为商业产品出售,只能通过 API 免费提供。jina-embeddings-v4 之所以看起来比其他模型慢,有两个原因:第一,jina-embeddings-v4 比 jina-embeddings-v3 大得多,每次请求本身就需要更多计算时间;第二,由于无法商业化,我们有意限制了 API 吞吐量以控制基础设施成本。使用 jina-embeddings-v4 API 时,请不要期待大批量或生产级的吞吐能力。如果生产负载需要更高吞吐,建议改用 jina-embeddings-v3,或从 Hugging Face 获取 jina-embeddings-v4 并部署在自有基础设施上。
Embeddings API 的速率限制是多少?
keyboard_arrow_down
速率限制取决于您的 API 密钥类型:

免费版: 100 RPM,100K TPM,2 个并发请求
付费版: 500 RPM,2M TPM,50 个并发请求
高级版: 5,000 RPM,50M TPM,500 个并发请求

此外,为了防止滥用,我们还设置了基于 IP 地址的速率限制,每 60 秒最多 10,000 个请求。如果您需要更高的限制,请联系我们的销售团队。
各个向量模型的上下文长度上限分别是多少?
keyboard_arrow_down
每个模型对单条输入的上下文长度上限如下:

jina-embeddings-v4: 32,768 词元
jina-embeddings-v3: 8,192 词元
jina-embeddings-v2-*: 8,192 词元
jina-clip-v1/v2: 8,192 词元
jina-colbert-v1/v2: 8,192 词元
jina-code-embeddings-*: 32,768 词元

超出上限的输入会返回错误,除非设置 truncate: true,届时会自动截断到最大长度。
图片和PDF文件的大小限制是多少?
keyboard_arrow_down
文件大小上限为:图片:5 MB,PDF:8 MB。超过上限的文件会被拒绝并返回错误。
重排模型常见问题
Reranker API 的费用是多少?
keyboard_arrow_down
Reranker API 的定价与向量模型 API 一致。每个新 API 密钥可获赠 1000 万免费词元,用完后可另行购买不同套餐。详情请查看我们的定价页面。
Jina 各款重排模型有什么区别?
keyboard_arrow_down
jina-reranker-v3 是我们最新的旗舰重排模型,采用全新的列表式架构,支持 131K 上下文长度,多语言检索效果业界领先。jina-reranker-m0 是多模态重排模型,可跨语言对视觉文档排序。jina-reranker-v2-base-multilingual 是交叉编码器,支持 100 多种语言,具备函数调用和代码检索能力。jina-colbert-v2 采用迟交互技术,支持 89 种语言,向量维度可由用户自定义。
Jina 的重排模型采用什么许可协议?
keyboard_arrow_down
我们所有的重排模型(jina-reranker-v3、jina-reranker-m0、jina-reranker-v2-base-multilingual 和 jina-colbert-v2)均以 CC-BY-NC 4.0 协议发布。您可以自由地将这些模型用于非商业目的,包括使用、分享和修改。如需商用,请与我们联系。
重排模型支持多种语言吗?
keyboard_arrow_down
支持,我们所有的重排模型都能做多语言检索。jina-reranker-v3 和 jina-reranker-v2-base-multilingual 支持 100 多种语言,jina-reranker-m0 支持多语言视觉文档排序,jina-colbert-v2 支持 89 种语言。
每个重排模型的最大上下文长度是多少?
keyboard_arrow_down
上下文长度因模型而异:

jina-reranker-v3: 131,072 个词元(查询 + 所有文档的总和),启用自动截断
jina-reranker-m0: 10,000 个词元
jina-reranker-v2-base-multilingual: 1,024 个词元,对较长的文档进行自动分块
jina-reranker-v1-*: 1,024 个词元,启用自动分块
jina-colbert-v2: 8,192 个词元

对于 v1/v2 重排模型,查询会自动截断,长文档会分块,并在块之间进行最大池化。
每次查询可重排的文档数量有上限吗?
keyboard_arrow_down
单次请求的文档数量没有硬性上限。与向量模型 API 一样,Reranker API 会按词元数在内部自动分批,以充分利用 GPU。您可以在一次请求中发送任意数量的文档。
对 100 个文档重排时,预计延迟会是多少?
keyboard_arrow_down
延迟从 100 毫秒到 7 秒不等,主要取决于文档和查询的长度。例如,使用 64 个词元的查询对 100 个包含 256 个词元的文档进行重排大约需要 150 毫秒。将文档长度增加到 4096 个词元将使时间增加到 3.5 秒。如果查询长度增加到 512 个词元,则时间进一步增加到 7 秒。
以下是对一个查询和 100 个文档进行重排的时间成本(以毫秒为单位):
每个文档中的词元数量
查询中的词元数量256512102420484096
64156323136621073571
128194369137721233598
256273475139721554299
5124681385211435367068
你们的端点可以在 AWS、Azure 或 GCP 上私有化部署吗?
keyboard_arrow_down
可以,我们的服务已上架 AWS、Azure 和 GCP 应用市场。如有特殊需求,请发邮件至 sales AT jina.ai 与我们联系。
launchAWS SageMakerlaunchGoogle CloudlaunchMicrosoft Azure
你们提供针对特定领域数据微调的重排模型吗?
keyboard_arrow_down
如果您需要针对特定领域数据微调的重排模型,请联系我们的销售团队,我们会尽快回复您。
联系我们
文档图片的最小尺寸是多少?
keyboard_arrow_down
jina-reranker-m0 模型可接受的最小图像尺寸为 28x28 像素。
什么是列表式重排?它和逐点式重排有何不同?
keyboard_arrow_down
jina-reranker-v3 采用全新的列表式架构,在一次前向计算中为所有文档统一打分,从而实现跨文档比较。传统的逐点式重排模型(如 v2)则把每篇文档单独与查询比对打分。列表式重排能把握整个候选集内部的相对相关性,因此准确率更高。
为什么 API 支持的上下文长度和模型的最大容量不一致?
keyboard_arrow_down
我们有些重排模型在架构上确实能处理更长的上下文,但受推理集群 GPU 显存限制,API 会设置更低的上限。处理超长序列需要占用大量显存,我们在服务配置上做了权衡,以兼顾大多数场景下的吞吐量、延迟和成本。如果您需要更长的上下文支持,请联系我们的销售团队,商讨专属部署方案。
Reranker API 的速率限制是多少?
keyboard_arrow_down
速率限制取决于您的 API 密钥类型:

免费版: 100 RPM,100K TPM,2 个并发请求
付费版: 500 RPM,2M TPM,50 个并发请求
高级版: 5,000 RPM,50M TPM,500 个并发请求

此外还有基于 IP 的速率限制:每 60 秒 10,000 次请求。向量模型 API 和 Reranker API 适用同一套速率限制。
API 相关常见问题
code
Reader、向量模型、重排、分类和微调 API 可以共用同一个 API 密钥吗?
keyboard_arrow_down
可以,同一个 API 密钥适用于 Jina AI 的所有搜索基础产品,包括 Reader、向量模型、重排、分类和微调 API,词元额度在各项服务之间共享。
code
我可以查看 API 密钥的词元用量吗?
keyboard_arrow_down
可以,在“API 密钥与计费”标签页输入您的 API 密钥,即可查看近期用量记录和剩余词元。如果您已登录 API 控制面板,也可以在“管理 API 密钥”标签页查看这些信息。
code
如果我忘记了 API 密钥,该怎么办?
keyboard_arrow_down
如果您弄丢了已充值的密钥并希望找回,请用注册邮箱联系 support AT jina.ai。建议登录账户,这样 API 密钥可以安全保存、随时取用。
联系我们
code
API 密钥会过期吗?
keyboard_arrow_down
不会,我们的 API 密钥没有有效期。但如果您怀疑密钥已泄露并希望停用,请联系我们的支持团队。您也可以在 API 密钥控制面板中自行销毁密钥。
联系我们
code
可以在不同 API 密钥之间转移词元吗?
keyboard_arrow_down
可以,您能把词元从一个高级密钥转到另一个密钥。在 API 密钥控制面板登录账户后,进入待转出密钥的设置页,即可转移全部剩余的付费词元。
code
我可以销毁我的 API 密钥吗?
keyboard_arrow_down
可以,如果您认为密钥已泄露,可以销毁它。销毁后,所有保存该密钥的用户都会立即无法使用,剩余额度和关联属性也将永久失效。如果是高级密钥,您可以在销毁前把剩余的付费额度转移到另一个密钥。请注意,此操作无法撤销。要销毁密钥,请前往 API 密钥控制面板中的密钥设置。
code
为什么有些模型的首次请求比较慢?
keyboard_arrow_down
这是因为我们的无服务器架构会在使用率较低时卸载部分模型。首次请求会激活或“预热”模型,需要几秒钟。激活之后,后续请求的处理速度会快得多。
code
我的 API 数据会被用来训练你们的模型吗?
keyboard_arrow_down
不会。我们绝不会用您的 API 请求、输入或输出来训练向量模型、重排模型或任何其他模型。您的数据始终属于您。
code
Jina API 的速率限制是多少?
keyboard_arrow_down
速率限制按 API 密钥计算:

免费版:100 RPM,100K TPM,2 个并发请求
付费版:500 RPM,2M TPM,50 个并发请求
高级版:5,000 RPM,50M TPM,500 个并发请求

此外还有基于 IP 的速率限制,每 60 秒 10,000 个请求。以上限制适用于所有 Jina API(Embeddings、Reranker、Reader 等)。
code
API 有批量大小限制吗?
keyboard_arrow_down
Embeddings 和 Reranker API 都没有批量大小限制,每次请求可以发送任意数量的条目或文档。两个 API 都会在内部按词元数对输入分批,以充分利用 GPU。
与计费相关的常见问题
attach_money
API 是按句子数还是按请求数计费?
keyboard_arrow_down
我们按处理的词元总数计费,您可以把这些词元灵活分配到任意数量的句子上,用更低的成本满足各种文本分析需求。
attach_money
新用户可以免费试用吗?
keyboard_arrow_down
我们为新用户提供免费试用:系统自动生成的 API 密钥内含一千万词元,可用于我们的任何模型。免费额度用完后,您可以在“充值”标签页为密钥购买更多词元。
attach_money
失败的请求是否会扣除词元?
keyboard_arrow_down
不,失败的请求不会扣除词元。
attach_money
接受哪些付款方式?
keyboard_arrow_down
付款通过 Stripe 处理,支持信用卡、Google Pay、PayPal 等多种方式,方便您选择。
attach_money
充值后可以开具发票吗?
keyboard_arrow_down
可以,充值后发票会发送到与您 Stripe 账户关联的邮箱。
DeepSearch 常见问题
什么是 DeepSearch?
keyboard_arrow_down
DeepSearch 是一个大模型 API,它会反复搜索、读取和推理,直到找到准确答案或用完词元预算。
DeepSearch 与 OpenAI、Gemini 的深度研究能力有何不同?
keyboard_arrow_down
与 OpenAI 和 Gemini 不同,DeepSearch 专注于通过迭代给出准确答案,而不是生成长篇文章。它面向深度网页搜索下的快速、精准回答做了优化,目标不是撰写详尽的研究报告。
使用 DeepSearch 需要什么 API 密钥?
keyboard_arrow_down
您需要一个 Jina API 密钥。新建的 API 密钥可获赠 1000 万免费词元。
DeepSearch 用完词元预算后会怎样?会返回不完整的答案吗?
keyboard_arrow_down
它会基于已积累的全部知识生成最终答案,而不是直接放弃或返回残缺的回答。
DeepSearch 能保证答案准确吗?
keyboard_arrow_down
不能。虽然它用迭代搜索来提升准确性,但评估显示其在测试题上的通过率为 75%,明显优于 0% 的基线(gemini-2.0-flash),但并不完美。
一次典型的 DeepSearch 查询要多久?
keyboard_arrow_down
差异很大。根据评估数据,一次查询可能需要 1 到 42 步,平均 4 步,约合 20 秒。简单查询很快就能解决,复杂的研究型问题则可能经过多轮迭代,最长需要 120 秒。
DeepSearch 能配合 Chatwise、CherryStudio、ChatBox 等兼容 OpenAI 的客户端使用吗?
keyboard_arrow_down
可以。官方 DeepSearch API(deepsearch.jina.ai/v1/chat/completions)与 OpenAI API schema 完全兼容,模型名填 “jina-deepsearch-v1” 即可。因此从 OpenAI 切换到 DeepSearch 非常简单,可搭配本地客户端或任何兼容 OpenAI 的客户端使用。我们非常推荐 Chatwise,体验更顺畅。
API 的速率限制是多少?
keyboard_arrow_down
速率限制随 API 密钥等级而异,从 10 RPM 到 30 RPM 不等。查询量大的应用需要重点考虑这一点。
标签里的内容是什么?
keyboard_arrow_down
DeepSearch 会把思考步骤包在 XML 标签 ... 中,随后再给出最终答案。整体遵循 OpenAI 流式输出格式,只是额外用这些标记标示思维链。
DeepSearch 的网页搜索和读取是否使用 Jina Reader?
keyboard_arrow_down
是的。网页搜索和读取由 Jina Reader 完成,使系统能高效访问和处理网页内容。
为什么 DeepSearch 处理我的查询要消耗这么多词元?
keyboard_arrow_down
确实,DeepSearch 在复杂查询上的词元消耗相当高,平均约 70,000 个词元,而基础大模型的回答约 500 个。这体现了研究的深度,但也意味着更高的成本。
有办法控制或限制步数吗?
keyboard_arrow_down
系统主要通过词元预算而非步数来控制。一旦超出词元预算,就会进入 Beast 模式生成最终答案。详见 reasoning_effort。
答案中的引用来源可靠吗?
keyboard_arrow_down
系统非常看重引用来源:如果一个答案看起来已经确定无疑却缺少引用,系统会继续搜索,而不会直接采纳该答案。
DeepSearch 能回答关于未来事件的问题吗?
keyboard_arrow_down
可以,但需要大量研究步骤。以“谁会在 2028 年当选总统”为例,它能通过多轮研究迭代处理这类推测性问题,只是此类预测的准确性无法保证。
分类器相关常见问题
零样本和少样本在标签使用上有何区别?
keyboard_arrow_down
零样本在分类时需要语义标签,训练时则不需要;少样本正相反,训练时需要标签,分类时不需要。因此零样本更适合灵活、即时的分类需求,少样本更适合类别固定、领域特定但会随时间演进的场景。
num_iters 有什么用?该怎么设置?
keyboard_arrow_down
num_iters 控制训练强度:值越高越能强化重要样本,值越低则可降低低可信度数据的影响。您可以给较新的样本设置更高的迭代次数,实现带时间权重的学习,这对应对不断变化的数据模式很有价值。
公开分类器的共享机制是怎样的?
keyboard_arrow_down
任何人只要拿到 classifier_id 就能使用公开分类器,消耗的是他自己的词元配额。使用者无法访问训练数据或配置,也看不到他人的分类请求,因此可以安全共享分类器。
少样本需要多少数据才能有好效果?
keyboard_arrow_down
少样本需要 200-400 条训练样本才能超过零样本分类。它最终能达到更高的准确率,但需要这段预热期才会见效。零样本则无需训练数据,一上手就能提供稳定的表现。
它能处理多种语言以及文本和图片吗?
keyboard_arrow_down
可以。API 支持用 jina-embeddings-v3 处理多语言查询,用 jina-clip-v2 或 jina-embeddings-v4 做多模态(文本/图片)分类,同一请求中可传入图片 URL 或 base64 编码图片。
我应该了解哪些硬性限制?
keyboard_arrow_down
零样本支持 256 个类别,分类器数量不限;少样本最多 16 个类别和 16 个分类器。两者都支持每次请求 1,024 条输入,每条输入 8,192 词元。
数据随时间变化时该怎么应对?
keyboard_arrow_down
少样本模式可通过 /train 端点持续更新,以适应变化的数据模式。数据分布改变时,您可以增量添加新样本或新类别,无需重建整个分类器。
我发送的训练数据之后会怎样?
keyboard_arrow_down
该 API 采用单遍在线学习:训练样本会更新分类器权重,但不会被留存。这意味着您无法回溯历史训练数据,但也因此保障了隐私、节省了资源。
零样本与少样本,什么时候用哪个?
keyboard_arrow_down
需要即时结果、以及需要用语义标签做灵活分类时,先用零样本。当您已有 200-400 条样本、需要更高准确率,或要处理特定领域/时效性强的数据时,再切换到少样本。
我可以针对不同的语言/任务使用不同的模型吗?
keyboard_arrow_down
可以。您可以选择 jina-embeddings-v3 做文本分类(尤其擅长多语言)、jina-clip-v2 做多模态分类(支持 89 种语言),或 jina-embeddings-v4 做通用的多模态多语言分类。
Segmenter 常见问题
Segmenter API 如何收费?
keyboard_arrow_down
Segmenter API 免费使用。提供 API 密钥即可获得更高的速率限制,且不会扣除您密钥中的词元。
如果我不提供 API 密钥,速率限制是多少?
keyboard_arrow_down
不提供 API 密钥时,Segmenter API 的速率限制为 20 RPM。
如果我提供 API 密钥,速率限制是多少?
keyboard_arrow_down
提供 API 密钥时,Segmenter API 的速率限制为 200 RPM;高级付费用户为 1000 RPM。
会扣除我 API 密钥中的词元吗?
keyboard_arrow_down
不会,您的 API 密钥仅用于提升速率限制。
Segmenter API 支持多语言吗?
keyboard_arrow_down
支持,Segmenter API 支持 100 多种语言。
GET 和 POST 请求有什么区别?
keyboard_arrow_down
GET 请求仅用于统计文本中的词元数,方便您直接作为计数器集成到应用中。POST 请求支持更多参数和功能,例如返回前 N 个或后 N 个词元。
单次请求最多可分词多长的文本?
keyboard_arrow_down
单次请求最多可发送 64k 个字符。
分块功能如何工作?是语义分块吗?
keyboard_arrow_down
分块功能依据常见的结构线索把长文档切成较小的分块,确保切出的每一块都语义完整。它本质上是一个(超大的!)正则表达式,按照通常与语义边界重合的句法特征来切分文本,例如句末、段落分隔、标点和某些连词。它不是语义分块。这个正则已经把正则表达式的能力发挥到了极限,在复杂度与性能之间取得平衡。正则无法真正理解语义,但借助常见的结构线索,它能很好地逼近上下文边界。
Segmenter API 如何处理 endoftext 之类的特殊词元?
keyboard_arrow_down
如果输入中包含特殊词元,Segmenter API 会把它们放入 special_tokens 字段。这样您可以轻松识别并按下游任务的需要处理,例如在把文本送入大模型前先删除它们,以防注入攻击。
分块支持英语以外的语言吗?
keyboard_arrow_down
除西方语言外,分块在中文、日语和韩语上同样表现良好。
自动微调常见问题
微调 API 的费用是多少?
keyboard_arrow_down
此功能目前处于 Beta 阶段,每微调一个模型消耗 100 万词元。如果您在 Embedding/Reranker API 上的 API 密钥词元充足,可直接使用;也可以新建一个 API 密钥,新密钥包含 1000 万免费词元。
我需要提供什么?需要自备训练数据吗?
keyboard_arrow_down
您无需提供任何训练数据。只需用自然语言描述目标领域(即您希望微调向量模型所擅长的领域),或提供一个 URL 作为参考,我们的系统就会生成合成数据来训练模型。
微调一个模型需要多长时间?
keyboard_arrow_down
大约 30 分钟。
微调后的模型存储在哪里?
keyboard_arrow_down
微调后的模型和合成数据会公开存放在 Hugging Face 模型库中。
如果我提供一个参考 URL,系统将如何使用它?
keyboard_arrow_down
系统会用 Reader API 抓取该 URL 的内容,再分析内容以归纳其语气和领域,并据此指导合成数据的生成。因此该 URL 应可公开访问,且能代表目标领域。
我可以针对特定语言微调模型吗?
keyboard_arrow_down
可以,您能针对非英语语言微调模型。系统会自动识别领域指令所用的语言,并据此生成合成数据。我们还建议为目标语言挑选合适的底座模型,例如面向德语领域时,应选择 “jina-embeddings-v2-base-de” 作为底座模型。
我可以微调非 Jina 向量模型吗,例如 bge-M3?
keyboard_arrow_down
不支持,我们的微调 API 仅支持 Jina v2 模型。
如何保证微调模型的质量?
keyboard_arrow_down
微调结束时,系统会用留出的测试集评估模型并给出性能指标。您会收到一封邮件,说明该测试集上微调前后的表现对比。我们也建议您在自己的测试集上评估模型,以确认质量。
如何生成合成数据?
keyboard_arrow_down
系统将您提供的目标领域指令与大模型智能体的推理相结合,生成合成数据,产出高难度负例三元组,这对训练高质量向量模型至关重要。更多细节请参阅我们即将发布在 Arxiv 上的研究论文。
我可以让微调模型和合成数据保持私有吗?
keyboard_arrow_down
目前不行。请注意,此功能仍处于 Beta 阶段。把微调后的模型和合成数据公开存放在 Hugging Face 模型库,有助于我们和社区评估训练质量。未来我们计划提供私有存储选项。
如何使用微调后的模型?
keyboard_arrow_down
所有微调模型都会上传到 Hugging Face,只需指定模型名称即可通过 SentenceTransformers 调用。
我一直没收到评估结果邮件,该怎么办?
keyboard_arrow_down
请先查看垃圾邮件文件夹。如果仍未找到,请用您填写的邮箱地址联系我们的支持团队。
联系我们
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。