Сегментатор

Бесплатный API для сегментации длинного текста на чанки и токенизации.

API сегментатора

Наш API Segmenter имеет решающее значение для помощи LLM в управлении вводом в рамках контекстных ограничений и оптимизации производительности модели. Он позволяет разработчикам подсчитывать токены и извлекать соответствующие текстовые сегменты, обеспечивая эффективную обработку данных и управление затратами.


Используйте GET-запрос для подсчета токенов

Используйте POST-запрос для получения дополнительных функций

Запрос
POST
curl "https://api.jina.ai/v1/segment" \
-H "Content-Type: application/json" \
-d @- <<EOFEOF
{ "content": "Jina AI: Your Search Foundation, Supercharged! 🚀\nIhrer Suchgrundlage, aufgeladen! 🚀\n您的搜索底座,从此不同!🚀\n検索ベース,もう二度と同じことはありません!🚀" }
EOFEOF


Что такое сегментатор?

Сегментатор — это важный компонент, который преобразует текст в токены или чанки, которые являются основными единицами данных, обрабатываемыми моделью эмбеддинга/реранжирования или LLM. Токены могут представлять целые слова, части слов или даже отдельные символы.

Молниеносное разбиение длинных документов на фрагменты!

Вы также можете использовать API Segmenter для разрезания длинных документов на более мелкие фрагменты, что упрощает их обработку в эмбеддингах или рераннерах. Мы используем общие структурные подсказки и набор правил и эвристик, которые хорошо работают с различными типами контента, например, языками Markdown, HTML, LaTeX и CJK.
Максимальная длина каждого чанка: 1000
Максимальное количество символов в каждом чанке. На практике длина чанка может быть меньше этого значения, если в тексте есть естественная граница.

Всего 0 чанков


API сегментатора бесплатен!

Указав свой ключ API, вы сможете получить доступ к более высокому лимиту скорости, и плата за ваш ключ взиматься не будет.
Ограничение скорости
Ограничения скорости отслеживаются двумя способами: RPM (запросы в минуту) и TPM (токены в минуту). Ограничения применяются для каждого IP/API-ключа и срабатывают при достижении порогового значения RPM или TPM. Когда вы указываете ключ API в заголовке запроса, мы отслеживаем ограничения скорости по ключу, а не по IP-адресу.
ProductAPI EndpointDescriptionw/o API Keyw/ Free API Keyw/ Paid API Keyw/ Premium API KeyAverage latencyToken Usage CountingAllowed Request
Reader APIhttps://r.jina.aiConverts a URL to LLM-friendly text20 RPM500 RPM500 RPM5000 RPM7.9sCount the number of tokens in the output response.GET/POST
Reader APIhttps://s.jina.aiSearch the web and convert results to LLM-friendly text100 RPM100 RPM1000 RPM2.5sEvery request costs a fixed number of tokens, starting from 10 000 tokensGET/POST
Embedding APIhttps://api.jina.ai/v1/embeddingsConvert text/images to fixed-length vectors100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Reranker APIhttps://api.jina.ai/v1/rerankRank documents by query100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Ограничение скорости
Ограничения скорости отслеживаются двумя способами: RPM (запросы в минуту) и TPM (токены в минуту). Ограничения применяются для каждого IP/API-ключа и срабатывают при достижении порогового значения RPM или TPM. Когда вы указываете ключ API в заголовке запроса, мы отслеживаем ограничения скорости по ключу, а не по IP-адресу.
ProductAPI EndpointDescriptionw/o API Keyw/ Free API Keyw/ Paid API Keyw/ Premium API KeyAverage latencyToken Usage CountingAllowed Request
Reader APIhttps://r.jina.aiConverts a URL to LLM-friendly text20 RPM500 RPM500 RPM5000 RPM7.9sCount the number of tokens in the output response.GET/POST
Reader APIhttps://s.jina.aiSearch the web and convert results to LLM-friendly text100 RPM100 RPM1000 RPM2.5sEvery request costs a fixed number of tokens, starting from 10 000 tokensGET/POST
Embedding APIhttps://api.jina.ai/v1/embeddingsConvert text/images to fixed-length vectors100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Reranker APIhttps://api.jina.ai/v1/rerankRank documents by query100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Общие вопросы, связанные с выставлением счетов