Elastic
Jina AI
Modelle
API
keyboard_arrow_down
Reader
Konvertieren Sie jede URL in Markdown für besseres Grounding von LLMs.
Einbettungen
Multimodale, mehrsprachige Einbettungen.
Reranker
Reranker zur Maximierung der Suchrelevanz.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenten
data_object
Schema
menu_book
Dokumentation
Einloggen
login

Einbettungen

Leistungsstarke multimodale, mehrsprachige Langkontext-Einbettungen für Such-, RAG- und Agentenanwendungen.

Einbettungs-API

Probieren Sie unsere Embedding-Modelle aus und verbessern Sie Ihre Such- und RAG-Systeme. Starten Sie mit einer kostenlosen Testphase!
keyAPI-Schlüssel und Abrechnung
codeVerwendung
more_horizMehr
chevron_leftchevron_right

home
speedRatenbegrenzung
bug_reportProblem melden
help_outlineFAQ
Status
chevron_leftchevron_right


upload
Anfrage
POST
curl "https://api.jina.ai/v1/embeddings" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $JINA_API_KEY" \
-d @- <<EOFEOF
{ "model": null, "normalized": true, "embedding_type": "float", "input": [ text_fieldsclose"Organic skincare for sensitive skin with aloe vera and chamomile: Imagine the soothing embrace of na…ing, healthy complexion.", text_fieldsclose"Bio-Hautpflege für empfindliche Haut mit Aloe Vera und Kamille: Erleben Sie die wohltuende Wirkung u…einen strahlenden Teint.", text_fieldsclose"Cuidado de la piel orgánico para piel sensible con aloe vera y manzanilla: Descubre el poder de la n…el radiante y saludable.", text_fieldsclose"针对敏感肌专门设计的天然有机护肤产品:体验由芦荟和洋甘菊提取物带来的自然呵护。我们的护肤产品特别为敏感肌设计,温和滋润,保护您的肌肤不受刺激。让您的肌肤告别不适,迎来健康光彩。", text_fieldsclose"新しいメイクのトレンドは鮮やかな色と革新的な技術に焦点を当てています: 今シーズンのメイクアップトレンドは、大胆な色彩と革新的な技術に注目しています。ネオンアイライナーからホログラフィックハイライターまで、クリエイティビティを解き放ち、毎回ユニークなルックを演出しましょう。" + Eingabe hinzufügen ] }
EOFEOF


v5-omni: Ein Embedding für alles

Text, Bild, Audio, Video – ein gemeinsamer Embedding-Raum, zwei Größen. v5-omni-small (1,6 Mrd.) ist das leistungsstärkste Open-Weight-Omni-Modell mit weniger als 2 Mrd. Parametern. v5-omni-nano (0,9 Mrd.) liefert wettbewerbsfähiges Retrieval mit unter 1 Mrd. Parametern. Beide sind byte-für-byte-kompatibel mit v5-text – eine Neuindizierung ist nicht erforderlich.
Versionshinweis lesenarrow_forward

v5-Text: Neue kleine mehrsprachige SOTA-Einbettungen

jina-embeddings-v5-text bietet Einbettungsqualität der fünften Generation in zwei effizienten Größen – einem kleinen Modell mit 677 Millionen und einem Nano-Modell mit 239 Millionen – mit aufgabenspezifischen LoRA-Adaptern, Matryoshka-Dimensionen, 32K Kontext und GGUF/MLX-Quantisierung für den Einsatz am Edge und setzt damit neue Maßstäbe für MMTEB, MTEB English und Retrieval-Aufgaben.
Versionshinweis lesenarrow_forward

Zwei Kaufmöglichkeiten

Abonnieren Sie unsere API oder kaufen Sie über Cloud-Anbieter.
radio_button_unchecked
cloud
Mit 3 Cloud-Service-Anbietern
Verwendet Ihr Unternehmen AWS oder Azure? Sie können unsere Modelle direkt auf der Cloud-Plattform Ihres Unternehmens einsetzen und die Abrechnung über das CSP-Konto abwickeln.
AWS SageMaker
Einbettungen
Reranker
Microsoft Azure
Einbettungen
Reranker
Google Cloud
Einbettungen
radio_button_checked
Mit Jina Search Foundation API
Der einfachste Weg, auf alle unsere Produkte zuzugreifen. Laden Sie Tokens unterwegs auf.
Laden Sie diesen API-Schlüssel mit weiteren Token auf
Abhängig von Ihrem Standort werden Ihnen möglicherweise USD, EUR oder andere Währungen in Rechnung gestellt. Es können Steuern anfallen.
Bitte geben Sie zum Aufladen den richtigen API-Schlüssel ein
Verstehen Sie die Ratenbegrenzung
Ratenbegrenzungen sind die maximale Anzahl von Anfragen, die pro Minute pro IP-Adresse/API-Schlüssel (RPM) an eine API gestellt werden können. Nachfolgend erfahren Sie mehr über die Ratenbegrenzungen für jedes Produkt und jede Stufe.
keyboard_arrow_down
Ratenbegrenzung
Ratenlimits werden auf zwei Arten erfasst: RPM (Anfragen pro Minute) und TPM (Token pro Minute). Die Limits werden pro IP/API-Schlüssel erzwungen und ausgelöst, wenn zuerst der RPM- oder TPM-Schwellenwert erreicht wird. Wenn Sie im Request-Header einen API-Schlüssel angeben, erfassen wir die Ratenlimits pro Schlüssel und nicht nach IP-Adresse.
ProduktAPI-EndpunktBeschreibungarrow_upwardohne API-Schlüsselkey_offmit kostenlosem API-Schlüsselkeymit kostenpflichtigem API-Schlüsselkeymit Premium-API-SchlüsselkeyDurchschnittliche LatenzZählung der Token-NutzungZulässige Anfrage
Reader-APIhttps://r.jina.aiURL in LLM-freundlichen Text konvertieren20 RPM500 RPM500 RPMtrending_up5000 RPM7.9sAnzahl der Token in der Ausgabeantwort zählenGET/POST
Reader-APIhttps://s.jina.aiDas Web durchsuchen und die Ergebnisse in LLM-freundlichen Text konvertierenblock100 RPM100 RPMtrending_up1000 RPM2.5sJede Anfrage kostet eine feste Anzahl an Token, beginnend bei 10000 TokenGET/POST
Einbettungs-APIhttps://api.jina.ai/v1/embeddingsText/Bilder in Vektoren mit fester Länge konvertierenblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
hängt von der Eingangsgröße ab
help
Anzahl der Token in der Eingabeanforderung zählenPOST
Reranker-APIhttps://api.jina.ai/v1/rerankDokumente nach Abfrage ordnenblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
hängt von der Eingangsgröße ab
help
Anzahl der Token in der Eingabeanforderung zählenPOST

On-Premises-Bereitstellung

Stellen Sie Jina Embeddings-Modelle in AWS SageMaker und Microsoft Azure und bald auch in Google Cloud Services bereit, oder wenden Sie sich an unser Vertriebsteam, um angepasste Kubernetes-Bereitstellungen für Ihre Virtual Private Cloud und Ihre lokalen Server zu erhalten.
AWS SageMaker
Einbettungen
Reranker
Microsoft Azure
Einbettungen
Reranker
Google Cloud
Einbettungen
API-Integrationen
Unsere Einbettungs-API ist nativ in verschiedene renommierte Datenbanken, Vektorspeicher, RAG- und LLMOps-Frameworks integriert. Kopieren Sie zunächst einfach Ihren API-Schlüssel und fügen Sie ihn in eine der aufgeführten Integrationen ein, um einen schnellen und reibungslosen Start zu ermöglichen.
Vector Store
LLMOps
RAG
Observability
open_in_new
MongoDB
open_in_new
DataStax
open_in_new
Qdrant
open_in_new
Pinecone
open_in_new
Chroma
open_in_new
Weaviate
open_in_new
Milvus
open_in_new
Epsilla
open_in_new
MyScale
open_in_new
LlamaIndex
open_in_new
Haystack
open_in_new
Langchain
open_in_new
Dify
open_in_new
SuperDuperDB
open_in_new
DashVector
open_in_new
Portkey
open_in_new
Baseten
open_in_new
TiDB
open_in_new
LanceDB
open_in_new
Carbon

Unsere Veröffentlichungen

Erfahren Sie, wie unsere bahnbrechenden Suchmodelle von Grund auf trainiert wurden, und werfen Sie einen Blick auf unsere neuesten Veröffentlichungen. Treffen Sie unser Team auf der EMNLP, SIGIR, ICLR, NeurIPS und ICML!
arXiv
Juli 20, 2026
jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
SIGIR 2026
Mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
SIGIR 2026
Februar 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation
ICLR 2026
Januar 22, 2026
Embedding Compression via Spherical Coordinates
arXiv
Dezember 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
Dezember 04, 2025
Jina-VLM: Small Multilingual Vision Language Model
AAAI 2026
Oktober 01, 2025
jina-reranker-v3: Last but Not Late Interaction for Document Reranking
NeurIPS 2025
August 31, 2025
Efficient Code Embeddings from Code Generation Models
EMNLP 2025
Juni 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval
ICLR 2025
März 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON
ACL 2025
Dezember 17, 2024
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
ICLR 2025
Dezember 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images
ECIR 2025
September 18, 2024
jina-embeddings-v3: Multilingual Embeddings With Task LoRA
SIGIR 2025
September 07, 2024
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models
EMNLP 2024
August 30, 2024
Jina-ColBERT-v2: A General-Purpose Multilingual Late Interaction Retriever
WWW 2025
Juni 21, 2024
Leveraging Passage Embeddings for Efficient Listwise Reranking with Large Language Models
ICML 2024
Mai 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever
arXiv
Februar 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings
arXiv
Oktober 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents
EMNLP 2023
Juli 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models
20 Veröffentlichungen insgesamt.

Erfahren Sie mehr über Einbettungen

Wo soll man mit Einbettungen anfangen? Wir helfen Ihnen weiter. Erfahren Sie in unserem umfassenden Leitfaden alles über Einbettungen von Grund auf.
Mai 12, 2026 • 7 Minuten gelesen
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
Mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
We introduce GELATO (Geometry-preserving Embeddings via Locked Aligned TOwers), a novel approach to multimodal embedding models. We build on the VLM-style architecture, in which non-text encoders are adapted to produce input for a language model, which in turn generates embeddings for all varieties of input. GELATO extends the two Jina Embeddings v5 Text models to support additional modality by adding encoders for images and audio. The backbone text embedding models and the added non-text modality encoders remain frozen. We only trained the connecting components, representing 0.35% of the total weights of the joint model. Additionally, the language model remains effectively unaltered, producing exactly the same embeddings for text inputs as the Jina Embeddings v5 Text models. The resulting jina-embeddings-v5-omni suite encodes text, image, audio, and video into a single semantic embedding space, yielding nearly equal performance to larger multimodal embedding models.
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
März 11, 2026 • 7 Minuten gelesen
Bootstrapping Audio Embeddings from Multimodal LLMs
Turn any multimodal LLM into a small audio embedding model that beats CLAP with 25x less data.
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
März 06, 2026 • 6 Minuten gelesen
Identifying Embedding Models from Raw Numerical Values
A tiny transformer that fingerprints embedding models by reading raw numerical digits. No feature engineering.
Han Xiao

Vergleich von Reranker, Vector Search und BM25

Die folgende Tabelle bietet einen umfassenden Vergleich von Reranker, Vector/Embeddings Search und BM25 und hebt deren Stärken und Schwächen in verschiedenen Kategorien hervor.
RerankerVektorsucheBM25
Beste fürVerbesserte Suchpräzision und RelevanzErste, schnelle FilterungAllgemeine Textsuche für weitreichende Abfragen
GranularitätDetailliert: Unterdokument und AbfragesegmentBreit: Ganze DokumenteMittelstufe: Verschiedene Textsegmente
Komplexität der AbfragezeitHochMittelNiedrig
Zeitkomplexität indizierenNicht benötigtHochNiedrig, nutzt vorgefertigten Index
Komplexität der TrainingszeitHochHochNicht benötigt
SuchqualitätHervorragend für differenzierte AbfragenAusgewogen zwischen Effizienz und GenauigkeitKonsistent und zuverlässig für eine breite Palette von Abfragen
StärkenSehr präzise mit tiefem KontextverständnisSchnell und effizient, mit mäßiger GenauigkeitHoch skalierbar, mit nachgewiesener Wirksamkeit
Testen Sie die Reranker-API kostenlosProbieren Sie die Einbettungs-API kostenlos aus

Die Evolution des Einbettungsplakats

Entdecken Sie das ideale Poster für Ihren Raum mit fesselnden Infografiken oder atemberaubenden Bildern, die die Entwicklung der Texteinbettungsmodelle seit 1950 nachzeichnen.
Erfahren Sie, wie wir es gemacht haben
shopping_cartKaufen Sie eine gedruckte Kopie

FAQ

Wie wurden die Jina-Einbettungsmodelle trainiert?
keyboard_arrow_down
Detaillierte Informationen zu unseren Trainingsprozessen, Datenquellen und Evaluierungen finden Sie in den technischen Berichten auf arXiv. Die jina-embeddings-v5-Textmodelle werden in zwei Schritten trainiert: Zunächst werden die Einbettungen aus einem größeren Lehrermodell extrahiert, anschließend werden die aufgabenspezifischen LoRA-Adapter mit den eingefrorenen Backbone-Gewichten trainiert. Die v5-omni-Multimodalvarianten ergänzen dies um einen dritten Schritt, in dem ausschließlich crossmodale Projektoren trainiert werden, während der Text-Backbone und die Adapter eingefroren bleiben.
launcharXiv
Welche multimodalen Einbettungsmodelle verwenden Sie?
keyboard_arrow_down
Unsere aktuellen multimodalen Modelle sind jina-embeddings-v5-omni-small (~1,74 Mrd. Parameter, 1024 Dimensionen, 32.000 Kontext) und jina-embeddings-v5-omni-nano (~1,04 Mrd. Parameter, 768 Dimensionen, 8.000 Kontext). Sie verarbeiten Text, Bilder, Audio, Video und PDFs in einem gemeinsamen Vektorraum. So können Sie in einer Modalität indizieren und in einer anderen abfragen, ohne neu indizieren zu müssen. Ihre reine Textausgabe entspricht der von jina-embeddings-v5-text-small bzw. jina-embeddings-v5-text-nano. Das bedeutet, dass Sie multimodale Eingaben zu einem bestehenden Textindex hinzufügen können, ohne diese neu einzubetten. jina-clip-v2 (865 Mio. Parameter) steht weiterhin als schlankere Option für Text und Bilder zur Verfügung.
launcharXiv
Welche Sprachen unterstützen Ihre Modelle?
keyboard_arrow_down
Alle seit 2024 veröffentlichten Modelle sind mehrsprachig. Das Modell jina-embeddings-v5-text-small und die v5-omni-Modelle basieren auf einem Qwen3-Backbone mit breiter mehrsprachiger Abdeckung. jina-embeddings-v5-text-nano basiert auf EuroBERT-210M und unterstützt 15 wichtige europäische und globale Sprachen, darunter Englisch, Französisch, Deutsch, Spanisch, Chinesisch, Japanisch, Arabisch und Hindi. jina-embeddings-v3 und jina-clip-v2 unterstützen 89 Sprachen. Die Benchmark-Ergebnisse für die einzelnen Sprachen finden Sie in den MMTEB-Ergebnissen im jeweiligen technischen Bericht des Modells.
launcharXiv
Was ist die maximale Kontextlänge für eine einzelne Eingabe?
keyboard_arrow_down
Die Kontextlänge variiert je nach Modell: jina-embeddings-v5-text-small und jina-embeddings-v5-omni-small unterstützen bis zu 32.768 Tokens, während jina-embeddings-v5-text-nano und jina-embeddings-v5-omni-nano 8.192 Tokens unterstützen. jina-embeddings-v4 und die jina-code-embeddings-Modelle unterstützen 32.768 Tokens; jina-embeddings-v3, jina-clip-v2 und jina-colbert-v2 unterstützen 8.192 Tokens. Eingaben, die das Limit überschreiten, führen zu einem Fehler, es sei denn, Sie setzen truncate: true.
Wie viele Eingaben kann ich maximal in eine einzelne Anfrage einbeziehen?
keyboard_arrow_down
Es gibt keine feste Begrenzung für die Anzahl der Elemente pro Anfrage. Die API verarbeitet Eingaben intern anhand der Tokenanzahl, um die GPU optimal zu nutzen. Daher können Sie beliebig viele Texte oder Bilder in einer einzigen Anfrage senden. PDFs bilden die Ausnahme: Senden Sie jeweils nur eine PDF-Datei pro Anfrage.
Wie kann ich Bilder, Audio-, Video- oder PDF-Dateien an die multimodalen Modelle senden?
keyboard_arrow_down
Übergeben Sie ein typisiertes Objekt im input-Array mithilfe eines image-, audio-, video- oder pdf-Schlüssels. Dessen Wert ist entweder eine öffentliche URL oder Base64-kodierte Bytes. Das Modell leitet jede Modalität an den entsprechenden Encoder weiter. Sie können Modalitäten innerhalb eines Batches beliebig mischen. Unterstützte Audioformate sind WAV, MP3, FLAC, OGG, M4A und Opus; Video wird in 32 gleichmäßig abgetasteten Frames verarbeitet. PDFs müssen einzeln pro Anfrage gesendet werden.
Wie schneiden Jina-Embeddings im Vergleich zu den neuesten OpenAI-, Cohere- und Voyage-Modellen ab?
keyboard_arrow_down
jina-embeddings-v5-text-small (677 Millionen Parameter) ist das leistungsstärkste Modell mit weniger als einer Milliarde Parametern auf MMTEB-Ebene. Es erzielt einen durchschnittlichen Wert von 67,0 auf Aufgabenebene und erreicht 71,7 auf Englisch-MTEB. jina-embeddings-v5-text-nano (239 Millionen Parameter) erzielt 65,5 Punkte auf MMTEB-Ebene und übertrifft damit alle Modelle, die wir mit weniger als 500 Millionen Parametern evaluiert haben. Unser Designziel ist die Leistungsfähigkeit pro Parameter und nicht die reine Größe. Daher sind diese Modelle kostengünstiger als die meisten Alternativen bei vergleichbarer oder besserer Retrievalqualität. Alle v5-Modelle unterstützen Matryoshka Representation Learning, sodass Sie die Dimensionen ohne erneutes Training auf 32 reduzieren können.
Wie nahtlos ist der Übergang von OpenAIs Text-Embedding-3-Large zu Ihrer Lösung?
keyboard_arrow_down
Der Übergang ist unkompliziert: unser API-Endpunkt entspricht den Eingabe- und Ausgabe-JSON-Schemas von OpenAIs text-embedding-3-large. In den meisten Codebasen müssen Sie daher lediglich die Basis-URL, den API-Schlüssel und den Modellnamen ändern. Dasselbe gilt für die Jina On-Prem-Container, die zusätzlich Schemas für Elastic Inference Service (EIS), Cohere, Voyage AI und Gemini bereitstellen. Jina-Modelle lassen sich somit problemlos in bestehende Codepfade integrieren. Beachten Sie, dass Einbettungen verschiedener Modellfamilien nicht vergleichbar sind. Sie müssen Ihren Korpus daher neu einbetten, anstatt Vektoren von zwei Anbietern in einem Index zu mischen. Für die On-Prem-Container selbst wenden Sie sich bitte an Elastic Sales.
Wie werden Tokens für Bilder und andere Nicht-Text-Eingaben berechnet?
keyboard_arrow_down
Text wird wie üblich gezählt. Nicht-Text-Eingaben werden vom jeweiligen Encoder in Tokens umgewandelt. Die Kosten hängen stark vom verwendeten Modell ab. Messen Sie daher mit Ihren eigenen Eingaben, anstatt Annahmen zu treffen. Als Richtwert: Ein Bild mit 600x600 Pixeln kostet ungefähr: • jina-embeddings-v5-omni-small: ~363 Tokens • jina-embeddings-v5-omni-nano: ~362 Tokens • jina-embeddings-v4: ~4.840 Tokens • jina-clip-v2: ~16.000 Tokens Die v5-omni-Modelle sind pro Bild um ein bis zwei Größenordnungen günstiger als die älteren Modelle. Jede Antwort enthält ein usage-Objekt mit der genauen Tokenanzahl für diese Anfrage, einschließlich einer image_tokens-Aufschlüsselung für multimodale Eingaben, sodass Sie die Kosten pro Aufruf überprüfen können.
Bieten Sie Modelle zum Einbetten von Bildern, Audio oder Video an?
keyboard_arrow_down
Ja. jina-embeddings-v5-omni-small und jina-embeddings-v5-omni-nano betten Text, Bilder, Audio, Video und PDFs in einen gemeinsamen Vektorraum ein. jina-embeddings-v4 und jina-clip-v2 verarbeiten Text und Bilder.
Können Jina-Embedding-Modelle anhand von privaten oder Firmendaten feinabgestimmt werden?
keyboard_arrow_down
Es gibt zwei Möglichkeiten. Die Self-Service-Variante ist die Fine-Tuning-API. Diese generiert synthetische Trainingsdaten anhand einer Beschreibung Ihrer Domäne und liefert ein feinabgestimmtes Modell, ohne dass Sie einen annotierten Datensatz erstellen müssen. Für die Feinabstimmung proprietärer Daten im Rahmen einer kommerziellen Vereinbarung, auf dedizierter Infrastruktur oder für ein Modell, das nicht in der Basismodellauswahl enthalten ist, wenden Sie sich bitte an Elastic Sales. Diese Aufträge werden über Elastic abgewickelt.
Kontakt
Können die Modelle privat, auf meiner eigenen Infrastruktur oder in meinem eigenen Cloud-Konto gehostet werden?
keyboard_arrow_down
Ja, auf zwei Arten. Jina-Modelle sind auf den Marktplätzen von AWS, Azure und GCP verfügbar, sodass Sie sie in Ihrem eigenen Cloud-Konto bereitstellen können. Für selbstverwaltete, lokale oder vom Internet getrennte Infrastrukturen bietet Elastic eine kommerzielle Lizenz namens Jina On-Prem an, die seit dem 10. August 2026 erhältlich ist. Diese Lizenz liefert die Modelle als vollständig offlinefähige Docker-Container ohne externe Aufrufe und ohne Lizenzserver. Um ein Angebot für eine der beiden Optionen zu erhalten, kontaktieren Sie Elastic Sales.
launchAWS SageMakerlaunchGoogle CloudlaunchMicrosoft Azure
Was ist der Parameter „task“ und wann sollte ich ihn verwenden?
keyboard_arrow_down
Der Parameter task wählt einen aufgabenspezifischen LoRa-Adapter für optimale Leistung aus. Verwenden Sie retrieval.query für Suchanfragen, retrieval.passage für zu durchsuchende Dokumente, text-matching für symmetrische Ähnlichkeitsanalysen wie Duplikat- oder Paraphrasenerkennung, classification für Kategorisierung und separation für Clustering. Da die Suche asymmetrisch ist, verschlechtert die Verwendung der falschen Seite des Such-/Textpaares die Ergebnisse messbar. Der Parameter wird von jina-embeddings-v5, jina-embeddings-v4 und jina-embeddings-v3 unterstützt.
Was versteht man unter „Late-Interaction Retrieval“ und welche Modelle unterstützen es?
keyboard_arrow_down
Late-Interaction behält Token-Vektoren bei, anstatt ein Dokument zu einem einzigen Vektor zusammenzufassen. Dadurch bleiben feine Details erhalten, allerdings auf Kosten eines größeren Index. jina-embeddings-v4 unterstützt über den Parameter output_type sowohl die dichte Einzelvektor-Ausgabe als auch die mehrvektorielle Late-Interaction-Ausgabe. jina-colbert-v2 ist ein dediziertes Modell für Late-Interaction. Für die meisten Retrieval-Pipelines ist ein dichtes v5-Modell mit anschließendem Reranker das bessere Verhältnis von Genauigkeit zu Kosten.
Was ist Late Chunking und wann sollte ich es anwenden?
keyboard_arrow_down
Late Chunking bettet zunächst das gesamte Dokument in ein Langzeitkontextmodell ein und leitet anschließend Chunk-Einbettungen aus den Token-Repräsentationen ab. Im Gegensatz zu Naive Chunking, das jeden Chunk isoliert einbettet, erhält Late Chunking den Kontext zwischen den Chunks. Dies verbessert die Retrieval-Qualität in RAG-Pipelines, in denen ein Chunk auf etwas verweist, das zuvor im Dokument definiert wurde. Aktivieren Sie Late Chunking mit dem Parameter late_chunking.
Warum erzwingt die API eine andere Kontextlänge als die vom Modell unterstützte?
keyboard_arrow_down
Einige Modelle sind architektonisch so ausgelegt, dass sie längere Kontexte verarbeiten können, als die gehostete API akzeptiert. Sehr lange Sequenzen beanspruchen viel GPU-Speicher. Wir optimieren die Serverkonfiguration, um Durchsatz, Latenz und Kosten für die meisten Anwendungsfälle optimal auszubalancieren. Benötigen Sie die volle architektonische Kontextlänge, führen Sie das Modell selbst aus: Kontaktieren Sie Elastic Sales bezüglich einer selbstverwalteten Bereitstellung.
Warum ist jina-embeddings-v4 kostenlos und warum ist es langsam?
keyboard_arrow_down
jina-embeddings-v4 basiert auf dem Qwen2-VL-Basismodell, das unter der Qwen Research License veröffentlicht wurde. Diese Lizenz erlaubt ausschließlich Forschungszwecke und nichtkommerzielle Nutzung. Daher können wir es nicht kommerziell lizenzieren und stellen es stattdessen kostenlos über die API zur Verfügung. Da es sich um ein 3,8-B-Parameter-Modell handelt, ist es pro Anfrage naturgemäß langsamer. Um die Infrastrukturkosten zu kontrollieren, drosseln wir den Durchsatz. Es ist nicht für Produktionsumgebungen geeignet und wird aus demselben Grund weder über den Elastic Inference Service noch als Teil von Jina On-Prem angeboten. Für den Produktiveinsatz empfehlen wir die jina-embeddings-v5-Familie: Sie ist schneller, erzielt bessere Ergebnisse bei Retrieval-Benchmarks und kann über Elastic Sales für die kommerzielle Nutzung lizenziert werden.
Welche Ratenbegrenzungen gelten für die Embeddings API?
keyboard_arrow_down
Die Ratenbegrenzungen hängen von Ihrem API-Schlüsseltyp ab:

Kostenlos: 100 RPM, 100.000 TPM
Kostenpflichtig: 500 RPM, 2 Mio. TPM
Premium: 5.000 RPM, 50 Mio. TPM

Zusätzlich gilt eine IP-basierte Begrenzung von 10.000 Anfragen pro 60 Sekunden, um Missbrauch zu verhindern. Die Begrenzungen gelten pro Schlüssel und werden über ein 60-Sekunden-Fenster gezählt, sodass Lastspitzen geglättet und nicht in eine Warteschlange gestellt werden. Eine Anfrage, die die Begrenzung überschreitet, gibt den HTTP-Statuscode 429 zurück und sollte mit exponentiellem Backoff wiederholt werden. Benötigen Sie höhere Limits als im Premium-Tarif oder dedizierte Kapazität ohne Begrenzung für gemeinsam genutzte Mandanten, wenden Sie sich bitte an Elastic Sales.
Welches Einbettungsmodell sollte ich wählen?
keyboard_arrow_down
Beginnen Sie mit jina-embeddings-v5-text-small für die Textsuche: Es ist das leistungsstärkste Modell unter 1 Milliarde Einträgen in unserem Angebot und verarbeitet 32.000 Kontextdaten. Wechseln Sie zu jina-embeddings-v5-text-nano, wenn Latenz, Kosten oder Edge-Hardware wichtiger sind als die absolute Genauigkeit. Verwenden Sie jina-embeddings-v5-omni-small oder v5-omni-nano für Bilder, Audio, Video oder PDFs; deren Textausgabe ist identisch mit dem entsprechenden Textmodell, sodass Sie Modalitäten zu einem bestehenden Index hinzufügen können, ohne sie erneut einzubetten. Verwenden Sie jina-code-embeddings-0.5b oder 1.5b für den Quellcode. Innerhalb einer Familie gilt: Je neuer, desto besser.
Welche Dateigrößenbeschränkungen gelten für Bilder und PDFs?
keyboard_arrow_down
Die maximale Dateigröße beträgt 5 MB für Bilder und 8 MB für PDFs. Größere Dateien werden mit einer Fehlermeldung abgelehnt.

Wie erhalte ich meinen API-Schlüssel?

video_not_supported

Wie hoch ist die Ratenbegrenzung?

Ratenbegrenzung
Ratenlimits werden auf zwei Arten erfasst: RPM (Anfragen pro Minute) und TPM (Token pro Minute). Die Limits werden pro IP/API-Schlüssel erzwungen und ausgelöst, wenn zuerst der RPM- oder TPM-Schwellenwert erreicht wird. Wenn Sie im Request-Header einen API-Schlüssel angeben, erfassen wir die Ratenlimits pro Schlüssel und nicht nach IP-Adresse.
ProduktAPI-EndpunktBeschreibungarrow_upwardohne API-Schlüsselkey_offmit kostenlosem API-Schlüsselkeymit kostenpflichtigem API-Schlüsselkeymit Premium-API-SchlüsselkeyDurchschnittliche LatenzZählung der Token-NutzungZulässige Anfrage
Reader-APIhttps://r.jina.aiURL in LLM-freundlichen Text konvertieren20 RPM500 RPM500 RPMtrending_up5000 RPM7.9sAnzahl der Token in der Ausgabeantwort zählenGET/POST
Reader-APIhttps://s.jina.aiDas Web durchsuchen und die Ergebnisse in LLM-freundlichen Text konvertierenblock100 RPM100 RPMtrending_up1000 RPM2.5sJede Anfrage kostet eine feste Anzahl an Token, beginnend bei 10000 TokenGET/POST
Einbettungs-APIhttps://api.jina.ai/v1/embeddingsText/Bilder in Vektoren mit fester Länge konvertierenblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
hängt von der Eingangsgröße ab
help
Anzahl der Token in der Eingabeanforderung zählenPOST
Reranker-APIhttps://api.jina.ai/v1/rerankDokumente nach Abfrage ordnenblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
hängt von der Eingangsgröße ab
help
Anzahl der Token in der Eingabeanforderung zählenPOST

Benötige ich eine gewerbliche Lizenz?

CC BY-NC Lizenz Selbstcheck

play_arrow
Nutzen Sie unsere gehostete API oder unsere offiziellen Images auf Azure, AWS oder GCP?
play_arrow
Ja
Es ist keine separate Lizenz erforderlich. Die kommerzielle Nutzung ist durch die Nutzungsbedingungen abgedeckt: Registrieren Sie sich und bezahlen Sie über diese Website oder den Cloud-Marktplatz.
play_arrow
NEIN
play_arrow
Verwenden Sie die Modellgewichte selbst in einem kommerziellen Produkt oder einer Dienstleistung?
play_arrow
NEIN
Es ist kein Kauf erforderlich. Herunterladen, Evaluieren, Benchmarking und die Nutzung für Forschungszwecke sind unter jeder von uns verwendeten Lizenz mit Quellenangabe gestattet.
play_arrow
Ja
play_arrow
Welche Lizenz besitzt das Model? Das ist auf der Seite des Models bei Hugging Face angegeben.
play_arrow
Apache-2.0
Apache-2.0 erlaubt die kommerzielle Nutzung. Es ist kein Kauf erforderlich. Dies umfasst unsere älteren Modelle der Generationen v1 und v2.
play_arrow
CC BY-NC 4.0
Sie benötigen eine kommerzielle Lizenz. Seit dem 10. August 2026 bietet Elastic eine solche Lizenz für Jina-Modelle als eigene SKU unter dem Namen Jina On-Prem an. Sie deckt selbstverwaltete, lokale und vom Netzwerk getrennte Bereitstellungen ab und erfordert kein Elasticsearch-Abonnement.
Wenn Sie bereits Elastic-Kunde sind, kann Ihr Account-Team dies zu Ihrem bestehenden Vertrag hinzufügen.
Kontaktieren Sie den Elastic-Vertrieb.
play_arrow
Qwen-Forschungslizenz
Eine Forschungslizenz erlaubt keine kommerzielle Nutzung, und eine kommerzielle Lizenz für unsere anderen Modelle erstreckt sich nicht darauf. Für dieses Modell gibt es keine kommerzielle Option, weder für die Eigeninstallation noch über die API. Wählen Sie stattdessen ein Modell unter einer der beiden anderen Lizenzen.
Häufige Fragen zu APIs
code
Kann ich denselben API-Schlüssel für alle Jina-APIs verwenden?
keyboard_arrow_down
Ja. Ein API-Schlüssel ist für alle Produkte der Jina AI Search Foundation gültig, einschließlich der APIs Reader, Embeddings, Reranker, Classifier und Segmenter, wobei die Token für alle gemeinsam genutzt werden.
code
Kann ich die Token-Nutzung meines API-Schlüssels überwachen?
keyboard_arrow_down
Ja, die Token-Nutzung kann auf der Registerkarte „API-Schlüssel und Abrechnung“ überwacht werden, indem Sie Ihren API-Schlüssel eingeben. So können Sie den aktuellen Nutzungsverlauf und die verbleibenden Token anzeigen. Wenn Sie sich beim API-Dashboard angemeldet haben, können diese Details auch auf der Registerkarte „API-Schlüssel verwalten“ angezeigt werden.
code
Was soll ich tun, wenn ich meinen API-Schlüssel vergesse?
keyboard_arrow_down
Wenn Sie einen aufgeladenen Schlüssel verlegt haben und ihn abrufen möchten, wenden Sie sich bitte mit Ihrer registrierten E-Mail-Adresse an support AT jina.ai. Es wird empfohlen, sich anzumelden, damit Ihr API-Schlüssel sicher gespeichert und leicht zugänglich bleibt.
Kontakt
code
Laufen API-Schlüssel ab?
keyboard_arrow_down
Nein, unsere API-Schlüssel haben kein Ablaufdatum. Sollte ein Schlüssel kompromittiert werden, können Sie ihn selbst im API-Schlüsselverwaltungs-Dashboard widerrufen. Der Widerruf wird sofort wirksam. Um Ausfallzeiten zu vermeiden, stellen Sie zunächst einen Ersatzschlüssel aus. Ihr verbleibendes Token-Guthaben bleibt auf Ihrem Konto, nicht auf dem widerrufenen Schlüssel. Falls Sie keinen Zugriff auf das Dashboard haben oder vermuten, dass Ihr Konto selbst kompromittiert wurde, wenden Sie sich bitte an den Elastic-Support.
Kontakt
code
Kann ich Token zwischen API-Schlüsseln übertragen?
keyboard_arrow_down
Ja, Sie können Token von einem Premium-Schlüssel auf einen anderen übertragen. Nachdem Sie sich auf dem API-Schlüsselverwaltungs-Dashboard bei Ihrem Konto angemeldet haben, verwenden Sie die Einstellungen des Schlüssels, den Sie übertragen möchten, um alle verbleibenden bezahlten Token zu übertragen.
code
Kann ich meinen API-Schlüssel widerrufen?
keyboard_arrow_down
Ja, Sie können Ihren API-Schlüssel widerrufen, wenn Sie glauben, dass er kompromittiert wurde. Durch das Widerrufen eines Schlüssels wird dieser sofort für alle Benutzer deaktiviert, die ihn gespeichert haben, und alle verbleibenden Guthaben und zugehörigen Eigenschaften werden dauerhaft unbrauchbar. Wenn es sich bei dem Schlüssel um einen Premium-Schlüssel handelt, haben Sie die Möglichkeit, das verbleibende bezahlte Guthaben vor dem Widerruf auf einen anderen Schlüssel zu übertragen. Beachten Sie, dass diese Aktion nicht rückgängig gemacht werden kann. Um einen Schlüssel zu widerrufen, gehen Sie zu den Schlüsseleinstellungen im Dashboard zur API-Schlüsselverwaltung.
code
Warum ist die erste Anfrage für einige Modelle langsam?
keyboard_arrow_down
Dies liegt daran, dass unsere serverlose Architektur bestimmte Modelle in Zeiten geringer Nutzung auslagert. Die erste Anfrage aktiviert oder „wärmt“ das Modell auf, was einige Sekunden dauern kann. Nach dieser ersten Aktivierung werden nachfolgende Anfragen viel schneller verarbeitet.
code
Werden meine API-Daten zum Trainieren Ihrer Modelle verwendet?
keyboard_arrow_down
Nein. Wir verwenden Ihre API-Anfragen, Eingaben oder Ausgaben niemals, um unsere Embedding-, Reranker- oder andere Modelle zu trainieren. Ihre Daten bleiben Ihre Daten.
code
Welche Ratenbegrenzungen gelten für Jina-APIs?
keyboard_arrow_down
Es gelten Ratenbegrenzungen pro API-Schlüssel:

Kostenlos: 100 Anfragen pro Minute (RPM), 100.000 Token pro Minute (TPM)
Kostenpflichtig: 500 Anfragen pro Minute (RPM), 2 Mio. Token pro Minute (TPM)
Premium: 5.000 Anfragen pro Minute (RPM), 50 Mio. Token pro Minute (TPM)

Zusätzlich gilt eine IP-basierte Begrenzung von 10.000 Anfragen pro 60 Sekunden. Die Grenzwerte variieren je nach Endpunkt; die Werte pro Endpunkt finden Sie in der obigen Tabelle.
code
Gibt es Beschränkungen hinsichtlich der Batchgröße für die APIs?
keyboard_arrow_down
Es gibt keine Beschränkung der Batchgröße für die Embeddings- und Reranker-APIs. Sie können beliebig viele Elemente oder Dokumente pro Anfrage senden. Beide APIs verarbeiten die Eingaben intern anhand der Tokenanzahl, um die GPU optimal auszulasten.
code
Sind die Jina-APIs dasselbe wie die Jina-Modelle innerhalb von Elastic?
keyboard_arrow_down
Nein, es handelt sich um drei separate Wege. Die Jina-APIs auf dieser Website sind Self-Service-APIs mit nutzungsbasierter Abrechnung (Pay-as-you-go) und einem Jina-API-Schlüssel. Der Elastic Inference Service (EIS) führt Jina-Modelle in der Elastic Cloud aus und wird über Ihr Elastic-Abonnement abgerechnet. Sie müssen keine Infrastruktur verwalten. Jina On-Prem ist eine kommerzielle Lizenz, die Elastic seit dem 10. August 2026 als eigene SKU anbietet. Sie ermöglicht die Ausführung der Modelle in Ihrer eigenen, selbstverwalteten, lokalen oder vom Netzwerk getrennten Infrastruktur. Für Informationen zu EIS und On-Prem wenden Sie sich bitte an den Elastic-Vertrieb.
Häufige Fragen zur Abrechnung
attach_money
Erfolgt die Abrechnung nach der Anzahl der Sätze bzw. Anfragen?
keyboard_arrow_down
Unser Preismodell basiert auf der Gesamtzahl der verarbeiteten Token und bietet Benutzern die Flexibilität, diese Token auf eine beliebige Anzahl von Sätzen zu verteilen. Dies bietet eine kostengünstige Lösung für unterschiedliche Textanalyseanforderungen.
attach_money
Gibt es eine kostenlose Testversion für neue Benutzer?
keyboard_arrow_down
Ja. Neue Nutzer erhalten automatisch einen API-Schlüssel mit kostenlosen Tokens, die für alle unsere Modelle verwendet werden können. Sobald die kostenlosen Tokens aufgebraucht sind, können Sie im Tab „Tokens kaufen“ weitere Tokens für den Schlüssel erwerben.
attach_money
Werden für fehlgeschlagene Anfragen Token berechnet?
keyboard_arrow_down
Nein, für fehlgeschlagene Anfragen werden keine Token abgezogen.
attach_money
Welche Zahlungsmethoden werden akzeptiert?
keyboard_arrow_down
Zahlungen werden über Stripe abgewickelt und unterstützen zu Ihrer Bequemlichkeit eine Vielzahl von Zahlungsmethoden, darunter Kreditkarten, Google Pay und PayPal.
attach_money
Ist eine Rechnungsstellung für Token-Käufe verfügbar?
keyboard_arrow_down
Bei Token-Käufen im Self-Service stellt Stripe zum Zeitpunkt des Kaufs eine Rechnung an die mit Ihrem Stripe-Konto verknüpfte E-Mail-Adresse aus. Benötigen Sie eine formelle Bestellung, einen ausgehandelten Vertrag, Beschaffungsunterlagen oder eine Sammelrechnung, die über Elastic und nicht über Stripe abgewickelt wird, wenden Sie sich bitte an Elastic Sales.
attach_money
Wie kann ich eine kommerzielle Lizenz anstelle von API-Tokens erwerben?
keyboard_arrow_down
Mit dem Kauf von Tokens auf dieser Website decken Sie die Nutzung der gehosteten Jina-APIs ab. Sie erhalten damit keine Lizenz zur Ausführung der Modellgewichte in Ihrer eigenen Infrastruktur. Hierfür bietet Elastic seit dem 10. August 2026 eine kommerzielle Lizenz als eigene SKU an, die jährlich und nicht pro Token abgerechnet wird. Kontaktieren Sie Elastic Sales für ein Angebot.
attach_money
Kann ich per Rechnung oder Bestellschein statt per Karte bezahlen?
keyboard_arrow_down
Der Kauf von Guthaben per Self-Service-Token wird über Stripe abgewickelt und automatisch an Ihre Stripe-Konto-E-Mail-Adresse in Rechnung gestellt. Für Bestellungen, Beschaffungsprozesse oder Mengen, die das Self-Service-Aufladevolumen übersteigen, wenden Sie sich bitte an Elastic Sales.
attach_money
Ich habe bezahlt, aber mein Kontostand oder mein Ratenlimit hat sich nicht geändert. Was sollte ich überprüfen?
keyboard_arrow_down
Guthaben und Ratenbegrenzungen sind an einen API-Schlüssel gebunden, nicht an das Konto. Überprüfen Sie daher zuerst den Schlüssel selbst und nicht die Kontoseite: Geben Sie ihn im Tab „API-Schlüssel & Abrechnung“ ein und bestätigen Sie dort Guthaben und Tarif. Falls das Konto mehrere Schlüssel enthält, befinden sich die Token auf dem Schlüssel, der aufgeladen wurde. Dies ist möglicherweise nicht der Schlüssel, den Ihre Anwendung sendet. Es kann außerdem einige Zeit dauern, bis ein neuer Tarif nach der Zahlung wirksam wird. Wenn der Schlüssel zwar Guthaben anzeigt, aber weiterhin auf den vorherigen Tarif beschränkt ist, wenden Sie sich bitte an den Support.
attach_money
Wie kann ich eine Zahlung stornieren, die automatische Aufladung stoppen oder eine gespeicherte Zahlungsmethode entfernen?
keyboard_arrow_down
Die Abrechnung erfolgt über das Kundenportal, das Sie über den Reiter „API-Schlüssel & Abrechnung“ erreichen. Dort können Sie die automatische Aufladung deaktivieren und gespeicherte Zahlungsmethoden löschen. Durch die Deaktivierung der automatischen Aufladung werden keine weiteren Gebühren erhoben, bereits gekauftes Guthaben bleibt jedoch nutzbar. Wenn Sie Ihr Konto und Ihre Daten löschen oder eine Rückerstattung beantragen möchten, wenden Sie sich bitte an den Support. Die Kontolöschung wird manuell bearbeitet und dauert einige Werktage. Sie erhalten eine schriftliche Bestätigung, sobald der Vorgang abgeschlossen ist.
Aktuelle Sprache / Design
Search Foundation
Reader
Einbettungen
Reranker
Jina API-Schlüssel abrufen
Ratenbegrenzung
Über uns
Neuigkeiten
Jina-Logo herunterladen
open_in_new
Elastic-Logo herunterladen
open_in_new
API-Status
Elastic © 2026.SicherheitAGBPrivatsphäreCookie-EinstellungenMeine persönlichen Daten nicht verkaufen oder weitergeben
Diese Website und alle zugehörigen Inhalte, Software, Produkte und Dienstleistungen sind ausschließlich für den professionellen Gebrauch bestimmt. Eine Nutzung durch Endverbraucher ist weder vorgesehen noch empfohlen.