Segmentierer

Kostenlose API zum Segmentieren langer Texte in Chunks und zur Tokenisierung.

Segmenter-API

Unsere Segmenter-API ist entscheidend, um LLMs dabei zu helfen, Eingaben innerhalb von Kontextgrenzen zu verwalten und die Modellleistung zu optimieren. Sie ermöglicht Entwicklern, Token zu zählen und relevante Textsegmente zu extrahieren, was eine effiziente Datenverarbeitung und Kostenverwaltung gewährleistet.


Verwenden Sie eine GET-Anfrage, um Token zu zählen

Verwenden Sie die POST-Anfrage für weitere Funktionen

Anfrage
POST
curl "https://api.jina.ai/v1/segment" \
-H "Content-Type: application/json" \
-d @- <<EOFEOF
{ "content": "Jina AI: Your Search Foundation, Supercharged! 🚀\nIhrer Suchgrundlage, aufgeladen! 🚀\n您的搜索底座,从此不同!🚀\n検索ベース,もう二度と同じことはありません!🚀" }
EOFEOF


Was ist ein Segmenter?

Ein Segmentierer ist eine wichtige Komponente, die Text in Tokens oder Chunks umwandelt. Dabei handelt es sich um die grundlegenden Dateneinheiten, die ein Embedding-/Reranker-Modell oder LLM verarbeitet. Token können ganze Wörter, Wortteile oder sogar einzelne Zeichen darstellen.

Blitzschnelles Zerlegen langer Dokumente in Blöcke!

Sie können die Segmenter-API auch verwenden, um lange Dokumente in kleinere Chunks zu zerlegen, sodass sie sich leichter mit Einbettungen oder Rerankern verarbeiten lassen. Wir nutzen gängige Strukturmerkmale sowie eine Reihe von Regeln und Heuristiken, die bei verschiedenen Inhaltstypen gut funktionieren, z. B. Markdown, HTML, LaTeX und CJK-Sprachen.
Maximale Länge jedes Chunks: 1000
Maximale Anzahl von Zeichen in jedem Block. In der Praxis kann die Blocklänge kleiner als dieser Wert sein, wenn es im Text eine natürliche Grenze gibt.

0 Chunks insgesamt


Segmenter-API ist kostenlos!

Durch die Angabe Ihres API-Schlüssels können Sie auf eine höhere Ratenbegrenzung zugreifen und für Ihren Schlüssel fallen keine Kosten an.
Ratenbegrenzung
Ratenlimits werden auf zwei Arten erfasst: RPM (Anfragen pro Minute) und TPM (Token pro Minute). Die Limits werden pro IP/API-Schlüssel erzwungen und ausgelöst, wenn zuerst der RPM- oder TPM-Schwellenwert erreicht wird. Wenn Sie im Request-Header einen API-Schlüssel angeben, erfassen wir die Ratenlimits pro Schlüssel und nicht nach IP-Adresse.
ProduktAPI-EndpunktBeschreibungohne API-Schlüsselmit kostenlosem API-Schlüsselmit kostenpflichtigem API-Schlüsselmit Premium-API-SchlüsselDurchschnittliche LatenzZählung der Token-NutzungZulässige Anfrage
Reader-APIhttps://r.jina.aiURL in LLM-freundlichen Text konvertieren20 RPM500 RPM500 RPM5000 RPM7.9sAnzahl der Token in der Ausgabeantwort zählenGET/POST
Reader-APIhttps://s.jina.aiDas Web durchsuchen und die Ergebnisse in LLM-freundlichen Text konvertieren100 RPM100 RPM1000 RPM2.5sJede Anfrage kostet eine feste Anzahl an Token, beginnend bei 10.000 TokenGET/POST
Einbettungs-APIhttps://api.jina.ai/v1/embeddingsText/Bilder in Vektoren mit fester Länge konvertieren100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
hängt von der Eingangsgröße ab
Anzahl der Token in der Eingabeanforderung zählenPOST
Reranker-APIhttps://api.jina.ai/v1/rerankDokumente nach Abfrage ordnen100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
hängt von der Eingangsgröße ab
Anzahl der Token in der Eingabeanforderung zählenPOST
Ratenbegrenzung
Ratenlimits werden auf zwei Arten erfasst: RPM (Anfragen pro Minute) und TPM (Token pro Minute). Die Limits werden pro IP/API-Schlüssel erzwungen und ausgelöst, wenn zuerst der RPM- oder TPM-Schwellenwert erreicht wird. Wenn Sie im Request-Header einen API-Schlüssel angeben, erfassen wir die Ratenlimits pro Schlüssel und nicht nach IP-Adresse.
ProduktAPI-EndpunktBeschreibungohne API-Schlüsselmit kostenlosem API-Schlüsselmit kostenpflichtigem API-Schlüsselmit Premium-API-SchlüsselDurchschnittliche LatenzZählung der Token-NutzungZulässige Anfrage
Reader-APIhttps://r.jina.aiURL in LLM-freundlichen Text konvertieren20 RPM500 RPM500 RPM5000 RPM7.9sAnzahl der Token in der Ausgabeantwort zählenGET/POST
Reader-APIhttps://s.jina.aiDas Web durchsuchen und die Ergebnisse in LLM-freundlichen Text konvertieren100 RPM100 RPM1000 RPM2.5sJede Anfrage kostet eine feste Anzahl an Token, beginnend bei 10.000 TokenGET/POST
Einbettungs-APIhttps://api.jina.ai/v1/embeddingsText/Bilder in Vektoren mit fester Länge konvertieren100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
hängt von der Eingangsgröße ab
Anzahl der Token in der Eingabeanforderung zählenPOST
Reranker-APIhttps://api.jina.ai/v1/rerankDokumente nach Abfrage ordnen100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
hängt von der Eingangsgröße ab
Anzahl der Token in der Eingabeanforderung zählenPOST
Häufige Fragen zur Abrechnung