Segmentierer

Kostenlose API zum Segmentieren langer Texte in Chunks und zur Tokenisierung.

Segmenter-API

Unsere Segmenter-API ist entscheidend, um LLMs dabei zu helfen, Eingaben innerhalb von Kontextgrenzen zu verwalten und die Modellleistung zu optimieren. Sie ermöglicht Entwicklern, Token zu zählen und relevante Textsegmente zu extrahieren, was eine effiziente Datenverarbeitung und Kostenverwaltung gewährleistet.


Verwenden Sie eine GET-Anfrage, um Token zu zählen

Verwenden Sie die POST-Anfrage für weitere Funktionen

Anfrage
POST
curl "https://api.jina.ai/v1/segment" \
-H "Content-Type: application/json" \
-d @- <<EOFEOF
{ "content": "Jina AI: Your Search Foundation, Supercharged! 🚀\nIhrer Suchgrundlage, aufgeladen! 🚀\n您的搜索底座,从此不同!🚀\n検索ベース,もう二度と同じことはありません!🚀" }
EOFEOF


Was ist ein Segmenter?

Ein Segmentierer ist eine wichtige Komponente, die Text in Tokens oder Chunks umwandelt. Dabei handelt es sich um die grundlegenden Dateneinheiten, die ein Embedding-/Reranker-Modell oder LLM verarbeitet. Token können ganze Wörter, Wortteile oder sogar einzelne Zeichen darstellen.

Blitzschnelles Zerlegen langer Dokumente in Blöcke!

Sie können die Segmenter-API auch verwenden, um lange Dokumente in kleinere Chunks zu zerlegen, sodass sie sich leichter mit Einbettungen oder Rerankern verarbeiten lassen. Wir nutzen gängige Strukturmerkmale sowie eine Reihe von Regeln und Heuristiken, die bei verschiedenen Inhaltstypen gut funktionieren, z. B. Markdown, HTML, LaTeX und CJK-Sprachen.
Maximale Länge jedes Chunks: 1000
Maximale Anzahl von Zeichen in jedem Block. In der Praxis kann die Blocklänge kleiner als dieser Wert sein, wenn es im Text eine natürliche Grenze gibt.

0 Chunks insgesamt


Segmenter-API ist kostenlos!

Durch die Angabe Ihres API-Schlüssels können Sie auf eine höhere Ratenbegrenzung zugreifen und für Ihren Schlüssel fallen keine Kosten an.
Ratenbegrenzung
Ratenlimits werden auf zwei Arten erfasst: RPM (Anfragen pro Minute) und TPM (Token pro Minute). Die Limits werden pro IP/API-Schlüssel erzwungen und ausgelöst, wenn zuerst der RPM- oder TPM-Schwellenwert erreicht wird. Wenn Sie im Request-Header einen API-Schlüssel angeben, erfassen wir die Ratenlimits pro Schlüssel und nicht nach IP-Adresse.
ProductAPI EndpointDescriptionw/o API Keyw/ Free API Keyw/ Paid API Keyw/ Premium API KeyAverage latencyToken Usage CountingAllowed Request
Reader APIhttps://r.jina.aiConverts a URL to LLM-friendly text20 RPM500 RPM500 RPM5000 RPM7.9sCount the number of tokens in the output response.GET/POST
Reader APIhttps://s.jina.aiSearch the web and convert results to LLM-friendly text100 RPM100 RPM1000 RPM2.5sEvery request costs a fixed number of tokens, starting from 10.000 tokensGET/POST
Embedding APIhttps://api.jina.ai/v1/embeddingsConvert text/images to fixed-length vectors100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Reranker APIhttps://api.jina.ai/v1/rerankRank documents by query100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Ratenbegrenzung
Ratenlimits werden auf zwei Arten erfasst: RPM (Anfragen pro Minute) und TPM (Token pro Minute). Die Limits werden pro IP/API-Schlüssel erzwungen und ausgelöst, wenn zuerst der RPM- oder TPM-Schwellenwert erreicht wird. Wenn Sie im Request-Header einen API-Schlüssel angeben, erfassen wir die Ratenlimits pro Schlüssel und nicht nach IP-Adresse.
ProductAPI EndpointDescriptionw/o API Keyw/ Free API Keyw/ Paid API Keyw/ Premium API KeyAverage latencyToken Usage CountingAllowed Request
Reader APIhttps://r.jina.aiConverts a URL to LLM-friendly text20 RPM500 RPM500 RPM5000 RPM7.9sCount the number of tokens in the output response.GET/POST
Reader APIhttps://s.jina.aiSearch the web and convert results to LLM-friendly text100 RPM100 RPM1000 RPM2.5sEvery request costs a fixed number of tokens, starting from 10.000 tokensGET/POST
Embedding APIhttps://api.jina.ai/v1/embeddingsConvert text/images to fixed-length vectors100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Reranker APIhttps://api.jina.ai/v1/rerankRank documents by query100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
depends on the input size
Count the number of tokens in the input request.POST
Häufige Fragen zur Abrechnung