Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login

Embeddings

Embeddings multimodaux multilingues à contexte long les plus performantes pour les applications de recherche, RAG et agents.

API embeddings

Améliorez vos systèmes de recherche et de RAG grâce à nos modèles d'embedding. Essayez-les gratuitement !
keyClé API et facturation
codeUsage
more_horizPlus
chevron_leftchevron_right

home
speedLimite de débit
bug_reportSoulever un problème
help_outlineFAQ
Statut
chevron_leftchevron_right


upload
Demande
POST
curl "https://api.jina.ai/v1/embeddings" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $JINA_API_KEY" \
-d @- <<EOFEOF
{ "model": null, "normalized": true, "embedding_type": "float", "input": [ text_fieldsclose"Organic skincare for sensitive skin with aloe vera and chamomile: Imagine the soothing embrace of na…ing, healthy complexion.", text_fieldsclose"Bio-Hautpflege für empfindliche Haut mit Aloe Vera und Kamille: Erleben Sie die wohltuende Wirkung u…einen strahlenden Teint.", text_fieldsclose"Cuidado de la piel orgánico para piel sensible con aloe vera y manzanilla: Descubre el poder de la n…el radiante y saludable.", text_fieldsclose"针对敏感肌专门设计的天然有机护肤产品:体验由芦荟和洋甘菊提取物带来的自然呵护。我们的护肤产品特别为敏感肌设计,温和滋润,保护您的肌肤不受刺激。让您的肌肤告别不适,迎来健康光彩。", text_fieldsclose"新しいメイクのトレンドは鮮やかな色と革新的な技術に焦点を当てています: 今シーズンのメイクアップトレンドは、大胆な色彩と革新的な技術に注目しています。ネオンアイライナーからホログラフィックハイライターまで、クリエイティビティを解き放ち、毎回ユニークなルックを演出しましょう。" + ajouter une entrée ] }
EOFEOF


v5-omni : Un seul embedding pour tous

Texte, image, audio, vidéo : un seul espace d'embeddings partagé, deux tailles. v5-omni-small (1,6 B) est le modèle omni à poids ouverts le plus performant sous les 2 milliards de paramètres. v5-omni-nano (0,9 B) offre une recherche compétitive sous le milliard de paramètres. Les deux sont compatibles octet par octet avec v5-text : aucune réindexation n'est nécessaire.
Lire la note de publicationarrow_forward

v5-text : Nouveaux embeddings multilingues de petite taille à l’état de l’art

jina-embeddings-v5-text offre une qualité d'embedding de cinquième génération dans deux tailles efficaces — un petit modèle de 677M et un nano modèle de 239M — avec des adaptateurs LoRA spécifiques à la tâche, des dimensions Matryoshka, un contexte de 32K et une quantification GGUF/MLX pour le déploiement en périphérie, établissant de nouvelles références pour les tâches MMTEB, MTEB English et de récupération.
Lire la note de publicationarrow_forward

Deux façons d'acheter

Abonnez-vous à notre API ou achetez via des fournisseurs de cloud.
radio_button_unchecked
cloud
Avec 3 fournisseurs de services cloud
Votre entreprise utilise-t-elle AWS ou Azure ? Déployez nos modèles directement sur la plateforme cloud de votre entreprise et gérez la facturation via le compte CSP.
AWS SageMaker
Embeddings
Reranker
Microsoft Azure
Embeddings
Reranker
Google Cloud
Embeddings
radio_button_checked
Avec l'API Jina Search Foundation
Le moyen le plus simple d'accéder à tous nos produits. Rechargez vos tokens au fur et à mesure.
Rechargez cette clé API avec plus de tokens
Selon votre emplacement, vous pouvez être facturé en USD, EUR ou dans d'autres devises. Des taxes peuvent s'appliquer.
Veuillez saisir la bonne clé API pour recharger
Comprendre la limite de débit
Les limites de débit correspondent au nombre maximal de requêtes pouvant être adressées à une API en une minute par adresse IP/clé API (RPM). Découvrez ci-dessous les limites de débit pour chaque produit et niveau.
keyboard_arrow_down
Limite de débit
Les limites de débit sont suivies de deux manières : RPM (requêtes par minute) et TPM (tokens par minute). Les limites sont appliquées par IP/clé API et sont déclenchées dès que le seuil RPM ou TPM est atteint. Lorsque vous fournissez une clé API dans l'en-tête de la requête, nous suivons les limites de débit par clé plutôt que par adresse IP.
ProduitPoint de terminaison de l'APIDescriptionarrow_upwardsans clé APIkey_offavec clé API gratuitekeyavec clé API payantekeyavec clé API PremiumkeyLatence moyenneComptage de l'utilisation des tokensDemande autorisée
API de Readerhttps://r.jina.aiConvertir l'URL en texte compatible LLM20 RPM500 RPM500 RPMtrending_up5000 RPM7.9sCompter le nombre de tokens dans la réponse de sortie.GET/POST
API de Readerhttps://s.jina.aiRechercher sur le web et convertir les résultats en texte adapté au LLMblock100 RPM100 RPMtrending_up1000 RPM2.5sChaque demande coûte un nombre fixe de tokens, à partir de 10000 tokensGET/POST
API de reclassementhttps://api.jina.ai/v1/rerankClasser les documents par requêteblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
dépend de la taille de l'entrée
help
Compter le nombre de tokens dans la demande d'entrée.POST
API embeddingshttps://api.jina.ai/v1/embeddingsConvertir du texte/des images en vecteurs de longueur fixeblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
dépend de la taille de l'entrée
help
Compter le nombre de tokens dans la demande d'entrée.POST

Déploiement sur site

Déployez les modèles Jina Embeddings dans AWS SageMaker et Microsoft Azure, et bientôt dans Google Cloud Services, ou contactez notre équipe commerciale pour obtenir des déploiements Kubernetes personnalisés pour votre cloud privé virtuel et vos serveurs sur site.
AWS SageMaker
Embeddings
Reranker
Microsoft Azure
Embeddings
Reranker
Google Cloud
Embeddings
Embeddings d'API
Notre API embeddings est nativement intégrée à diverses bases de données renommées, magasins de vecteurs, frameworks RAG et LLMOps. Pour commencer, copiez et collez simplement votre clé API dans l'une des embeddings répertoriées pour un démarrage rapide et transparent.
Magasin de vecteurs
LLMOps
RAG
Observabilité
open_in_new
MongoDB
open_in_new
DataStax
open_in_new
Qdrant
open_in_new
Pinecone
open_in_new
Chroma
open_in_new
Weaviate
open_in_new
Milvus
open_in_new
Epsilla
open_in_new
MyScale
open_in_new
LlamaIndex
open_in_new
Haystack
open_in_new
Langchain
open_in_new
Dify
open_in_new
SuperDuperDB
open_in_new
DashVector
open_in_new
Portkey
open_in_new
Baseten
open_in_new
TiDB
open_in_new
LanceDB
open_in_new
Carbon

Nos publications

Découvrez comment nos modèles de recherche de frontière ont été entraînés à partir de zéro et consultez nos dernières publications. Rencontrez notre équipe à EMNLP, SIGIR, ICLR, NeurIPS et ICML !
arXiv
juillet 20, 2026
jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
SIGIR 2026
mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
SIGIR 2026
février 17, 2026
jina-embeddings-v5-text: Task-Targeted Embedding Distillation
ICLR 2026
janvier 22, 2026
Embedding Compression via Spherical Coordinates
arXiv
décembre 29, 2025
Vision Encoders in Vision-Language Models: A Survey
ICLR 2026
décembre 04, 2025
Jina-VLM: Small Multilingual Vision Language Model
AAAI 2026
octobre 01, 2025
jina-reranker-v3: Last but Not Late Interaction for Document Reranking
NeurIPS 2025
août 31, 2025
Efficient Code Embeddings from Code Generation Models
EMNLP 2025
juin 24, 2025
jina-embeddings-v4: Universal Embeddings for Multimodal Multilingual Retrieval
ICLR 2025
mars 04, 2025
ReaderLM-v2: Small Language Model for HTML to Markdown and JSON
ACL 2025
décembre 17, 2024
AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark
ICLR 2025
décembre 12, 2024
jina-clip-v2: Multilingual Multimodal Embeddings for Text and Images
ECIR 2025
septembre 18, 2024
jina-embeddings-v3: Multilingual Embeddings With Task LoRA
SIGIR 2025
septembre 07, 2024
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models
EMNLP 2024
août 30, 2024
Jina-ColBERT-v2: A General-Purpose Multilingual Late Interaction Retriever
WWW 2025
juin 21, 2024
Leveraging Passage Embeddings for Efficient Listwise Reranking with Large Language Models
ICML 2024
mai 30, 2024
Jina CLIP: Your CLIP Model Is Also Your Text Retriever
arXiv
février 26, 2024
Multi-Task Contrastive Learning for 8192-Token Bilingual Text Embeddings
arXiv
octobre 30, 2023
Jina Embeddings 2: 8192-Token General-Purpose Text Embeddings for Long Documents
EMNLP 2023
juillet 20, 2023
Jina Embeddings: A Novel Set of High-Performance Sentence Embedding Models
20 publications au total.

En savoir plus sur les embeddings

Par où commencer avec les embeddings ? Nous avons ce qu'il vous faut. Découvrez les embeddings de A à Z avec notre guide complet.
mai 12, 2026 • 7 minutes lues
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
One model, four modalities: text, image, audio, video. Best-in-class omni embeddings in 1.6B and 0.9B.
Han Xiao
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
mai 11, 2026
jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers
We introduce GELATO (Geometry-preserving Embeddings via Locked Aligned TOwers), a novel approach to multimodal embedding models. We build on the VLM-style architecture, in which non-text encoders are adapted to produce input for a language model, which in turn generates embeddings for all varieties of input. GELATO extends the two Jina Embeddings v5 Text models to support additional modality by adding encoders for images and audio. The backbone text embedding models and the added non-text modality encoders remain frozen. We only trained the connecting components, representing 0.35% of the total weights of the joint model. Additionally, the language model remains effectively unaltered, producing exactly the same embeddings for text inputs as the Jina Embeddings v5 Text models. The resulting jina-embeddings-v5-omni suite encodes text, image, audio, and video into a single semantic embedding space, yielding nearly equal performance to larger multimodal embedding models.
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
mars 11, 2026 • 7 minutes lues
Bootstrapping Audio Embeddings from Multimodal LLMs
Turn any multimodal LLM into a small audio embedding model that beats CLAP with 25x less data.
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
mars 06, 2026 • 6 minutes lues
Identifying Embedding Models from Raw Numerical Values
A tiny transformer that fingerprints embedding models by reading raw numerical digits. No feature engineering.
Han Xiao

Comparaison de Reranker, Vector Search et BM25

Le tableau ci-dessous fournit une comparaison complète du Reranker, de la recherche Vector/Embeddings et du BM25, mettant en évidence leurs forces et leurs faiblesses dans diverses catégories.
ReclasseurRecherche de vecteursBM25
Meilleur pourPrécision et pertinence de recherche amélioréesFiltrage initial et rapideRécupération de texte générale pour des requêtes étendues
GranularitéDétaillé : sous-document et segment de requêteLarge : documents entiersIntermédiaire : divers segments de texte
Complexité du temps de requêteHautMoyenFaible
Complexité du temps d’indexationNon requisHautFaible, utilise un index prédéfini
Complexité du temps d'entraînementHautHautNon requis
Qualité de la rechercheSupérieur pour les requêtes nuancéesÉquilibré entre efficacité et précisionCohérent et fiable pour un large éventail de requêtes
ForcesTrès précis avec une compréhension contextuelle approfondieRapide et efficace, avec une précision modéréeHautement évolutif, avec une efficacité établie
Essayez l'API de reclassement gratuitementEssayez l'API d'embedding gratuitement

L'évolution des embeddings Poster

Découvrez l'affiche idéale pour votre espace, présentant des infographies captivantes ou des visuels à couper le souffle retraçant l'évolution des modèles d'embedding de texte depuis 1950.
Découvrez comment nous l'avons fait
shopping_cartAcheter une copie papier

FAQ

Comment les modèles d'embedding Jina ont-ils été entraînés ?
keyboard_arrow_down
Pour des informations détaillées sur nos processus d'entraînement, nos sources de données et nos évaluations, veuillez consulter les rapports techniques sur arXiv. Les modèles de texte jina-embeddings-v5 sont entraînés en deux étapes : une distillation des embeddings à partir d'un modèle enseignant plus large, suivie d'un entraînement des adaptateurs LoRA spécifiques à la tâche sur les poids du réseau de base figés. Les variantes multimodales v5-omni ajoutent une troisième étape qui entraîne uniquement les projecteurs intermodaux, en laissant le réseau de base et les adaptateurs de texte figés.
launcharXiv
Quels sont vos modèles d'embedding multimodaux ?
keyboard_arrow_down
Nos modèles multimodaux actuels sont jina-embeddings-v5-omni-small (environ 1,74 milliard de paramètres, 1 024 dimensions, 32 000 contextes) et jina-embeddings-v5-omni-nano (environ 1,04 milliard de paramètres, 768 dimensions, 8 000 contextes). Ils acceptent le texte, les images, l’audio, la vidéo et les PDF dans un espace vectoriel partagé, ce qui permet d’indexer dans une modalité et d’effectuer des requêtes dans une autre sans réindexation. Leur rendu en mode texte seul est identique à celui de jina-embeddings-v5-text-small et jina-embeddings-v5-text-nano respectivement, ce qui signifie qu’il est possible d’ajouter des données multimodales à un index de texte existant sans réembedding. jina-clip-v2 (865 millions de paramètres) reste disponible comme option plus légère pour le traitement du texte et des images.
launcharXiv
Quelles langues vos modèles prennent-ils en charge ?
keyboard_arrow_down
Tous les modèles publiés depuis 2024 sont multilingues. Les modèles jina-embeddings-v5-text-small et v5-omni reposent sur une architecture Qwen3 offrant une large couverture multilingue ; jina-embeddings-v5-text-nano est basé sur EuroBERT-210M et couvre 15 langues européennes et internationales majeures, dont l’anglais, le français, l’allemand, l’espagnol, le chinois, le japonais, l’arabe et l’hindi. Les modèles jina-embeddings-v3 et jina-clip-v2 prennent en charge 89 langues. Pour consulter les résultats des tests de performance par langue, reportez-vous aux résultats MMTEB dans le rapport technique de chaque modèle.
launcharXiv
Quelle est la longueur maximale du contexte pour une entrée unique ?
keyboard_arrow_down
La longueur du contexte varie selon le modèle : jina-embeddings-v5-text-small et jina-embeddings-v5-omni-small prennent en charge jusqu’à 32 768 tokens, tandis que jina-embeddings-v5-text-nano et jina-embeddings-v5-omni-nano en prennent en charge 8 192. Les modèles jina-embeddings-v4 et jina-code-embeddings prennent en charge 32 768 tokens ; jina-embeddings-v3, jina-clip-v2 et jina-colbert-v2 en prennent en charge 8 192. Les entrées dépassant cette limite renvoient une erreur, sauf si vous définissez truncate: true.
Quel est le nombre maximal d'entrées que je peux inclure dans une seule requête ?
keyboard_arrow_down
Il n'y a pas de limite stricte au nombre d'éléments par requête. L'API regroupe les entrées en interne par nombre de tokens pour une utilisation optimale du GPU ; vous pouvez donc envoyer autant de textes ou d'images que nécessaire en une seule requête. Les fichiers PDF font exception : envoyez-en un par requête.
Comment envoyer des images, de l'audio, de la vidéo ou des PDF aux modèles multimodaux ?
keyboard_arrow_down
Transmettez un objet typé dans le tableau input à l'aide d'une clé image, audio, video ou pdf, dont la valeur est soit une URL publique, soit des octets encodés en base64. Le modèle achemine chaque modalité vers l'encodeur approprié, et vous pouvez combiner librement les modalités au sein d'un même lot. Les formats audio pris en charge sont WAV, MP3, FLAC, OGG, M4A et Opus ; la vidéo est traitée en 32 images échantillonnées uniformément. Les fichiers PDF doivent être envoyés un par requête.
Comment les représentations vectorielles de Jina se comparent-elles aux derniers modèles OpenAI, Cohere et Voyage ?
keyboard_arrow_down
Le modèle jina-embeddings-v5-text-small (677 millions de paramètres) est le plus performant avec moins d'un milliard de paramètres sur MMTEB, avec un score moyen de 67,0 au niveau de la tâche et de 71,7 en moyenne sur English MTEB. Le modèle jina-embeddings-v5-text-nano (239 millions de paramètres) obtient un score de 65,5 sur MMTEB, surpassant tous les modèles évalués avec moins de 500 millions de paramètres. Notre objectif est d'optimiser les performances par paramètre plutôt que de maximiser la taille des modèles ; ces derniers sont donc plus économiques à déployer que la plupart des alternatives offrant une qualité de recherche comparable, voire supérieure. Tous les modèles v5 prennent en charge l'apprentissage par représentation Matryoshka, ce qui permet de réduire la dimensionnalité à 32 sans réentraînement.
Dans quelle mesure la transition entre Text-Embedding-3-Large d'OpenAI et votre solution est-elle transparente ?
keyboard_arrow_down
La transition est simple : notre point de terminaison API correspond aux schémas JSON d'entrée et de sortie du modèle text-embedding-3-large d'OpenAI. Ainsi, dans la plupart des bases de code, il suffit de modifier l'URL de base, la clé API et le nom du modèle. Il en va de même pour les conteneurs Jina On-Prem, qui exposent également les schémas d'Elastic Inference Service (EIS), de Cohere, de Voyage AI et de Gemini. Les modèles Jina s'intègrent donc facilement dans le code existant. Attention : les embeddings de différentes familles de modèles ne sont pas comparables. Il est donc nécessaire de réintégrer votre corpus plutôt que de mélanger les vecteurs de deux fournisseurs dans un seul index. Pour les conteneurs On-Prem, contactez le service commercial d'Elastic.
Comment les tokens sont-ils calculés pour les images et autres entrées non textuelles ?
keyboard_arrow_down
Le texte est comptabilisé de manière standard. Les entrées non textuelles sont converties en tokens par l'encodeur approprié, et le coût dépend fortement du modèle utilisé. Il est donc conseillé de réaliser des mesures avec vos propres données d'entrée plutôt que de faire des suppositions. À titre indicatif, une image de 600 x 600 pixels coûte approximativement : • jina-embeddings-v5-omni-small : ~363 tokens • jina-embeddings-v5-omni-nano : ~362 tokens • jina-embeddings-v4 : ~4 840 tokens • jina-clip-v2 : ~16 000 tokens Les modèles v5-omni sont de cent à cent fois moins chers par image que les modèles précédents. Chaque réponse inclut un objet usage avec le nombre exact de tokens pour cette requête, y compris une ventilation image_tokens pour les entrées multimodales, afin que vous puissiez vérifier le coût par appel.
Fournissez-vous des modèles pour intégrer des images, de l'audio ou de la vidéo ?
keyboard_arrow_down
Oui. Les modules jina-embeddings-v5-omni-small et jina-embeddings-v5-omni-nano intègrent du texte, des images, de l'audio, de la vidéo et des PDF dans un seul espace vectoriel partagé. Les modules jina-embeddings-v4 et jina-clip-v2 gèrent le texte et les images.
Les modèles d'embedding Jina peuvent-ils être affinés sur des données privées ou d'entreprise ?
keyboard_arrow_down
Deux options s'offrent à vous. La première, en libre-service, utilise l'API de réglage fin. Celle-ci génère des données d'entraînement synthétiques à partir d'une description de votre domaine et vous fournit un modèle optimisé, sans que vous ayez à constituer un jeu de données étiqueté. Pour un réglage fin sur des données propriétaires faisant l'objet d'un accord commercial, sur une infrastructure dédiée ou sur un modèle ne figurant pas dans le sélecteur de modèles de base, veuillez contacter Elastic Sales. Ce type de prestation est défini et contractualisé par Elastic.
Contact
Les modèles peuvent-ils être hébergés de manière privée, sur ma propre infrastructure ou dans mon propre compte cloud ?
keyboard_arrow_down
Oui, de deux manières. Les modèles Jina sont disponibles sur les places de marché AWS, Azure et GCP, ce qui vous permet de les déployer dans votre propre compte cloud. Pour les infrastructures autogérées, sur site ou isolées du réseau, Elastic propose une licence commerciale appelée Jina On-Prem, disponible depuis le 10 août 2026. Cette licence fournit les modèles sous forme de conteneurs Docker entièrement hors ligne, sans appels externes ni serveur de licences. Pour obtenir un devis pour l'une ou l'autre option, contactez le service commercial d'Elastic.
launchAWS SageMakerlaunchGoogle CloudlaunchMicrosoft Azure
Qu’est-ce que le paramètre « task » et quand dois-je l’utiliser ?
keyboard_arrow_down
Le paramètre task sélectionne un adaptateur LoRA spécifique à la tâche pour des performances optimales. Utilisez retrieval.query pour les requêtes de recherche, retrieval.passage pour les documents recherchés, text-matching pour la similarité symétrique (détection de doublons ou de paraphrases), classification pour la catégorisation et separation pour le regroupement. La recherche étant asymétrique, utiliser le mauvais côté de la paire requête/passage dégrade sensiblement les résultats. Ce paramètre est compatible avec jina-embeddings-v5, jina-embeddings-v4 et jina-embeddings-v3.
Qu’est-ce que la récupération late-interaction et quels modèles la prennent en charge ?
keyboard_arrow_down
Le late-interaction conserve les vecteurs au niveau des tokens au lieu de fusionner un document en un seul vecteur, préservant ainsi les détails fins au prix d'un index plus volumineux. jina-embeddings-v4 prend en charge les sorties denses (vecteur unique) et late-interaction (vecteurs multiples) via le paramètre output_type, tandis que jina-colbert-v2 est un modèle dédié au late-interaction. Pour la plupart des pipelines de recherche, un modèle dense v5 suivi d'un réordonnanceur offre un meilleur compromis précision/coût.
Qu’est-ce que le découpage tardif et quand dois-je l’utiliser ?
keyboard_arrow_down
Le découpage tardif intègre d'abord l'intégralité du document à l'aide d'un modèle de contexte long, puis dérive les représentations des segments à partir des tokens. Contrairement au découpage naïf, qui intègre chaque segment isolément, le découpage tardif préserve le contexte inter-segments, ce qui améliore la qualité de la recherche dans les pipelines RAG où un segment fait référence à un élément défini plus haut dans le document. Activez-le avec le paramètre late_chunking.
Pourquoi l'API impose-t-elle une longueur de contexte différente de celle prise en charge par le modèle ?
keyboard_arrow_down
Certains modèles sont conçus pour gérer un contexte plus long que celui accepté par l'API hébergée. Les séquences très longues consomment une quantité importante de mémoire GPU ; nous optimisons donc la configuration de diffusion afin d'équilibrer débit, latence et coût pour la plupart des cas d'utilisation. Si vous avez besoin de la longueur complète du contexte architectural, exécutez le modèle vous-même : contactez Elastic Sales pour un déploiement autogéré.
Pourquoi jina-embeddings-v4 est-il gratuit, et pourquoi est-il lent ?
keyboard_arrow_down
Le module jina-embeddings-v4 est basé sur le modèle Qwen2-VL et distribué sous licence de recherche Qwen, qui autorise uniquement la recherche et une utilisation non commerciale. Par conséquent, nous ne pouvons pas le commercialiser et le proposons gratuitement via l'API. Ce modèle comporte 3,8 milliards de paramètres, ce qui le rend intrinsèquement plus lent par requête. De plus, son débit est limité afin de maîtriser les coûts d'infrastructure. Il n'est pas adapté aux charges de travail en production et, pour la même raison, n'est pas proposé via Elastic Inference Service ni dans le cadre de Jina On-Prem. Pour une utilisation en production, privilégiez la famille jina-embeddings-v5 : plus rapide et plus performante en termes de performances de recherche, elle peut être commercialisée via Elastic Sales.
Quelles sont les limites de débit de l'API Embeddings ?
keyboard_arrow_down
Les limites de débit dépendent du type de votre clé API :

Gratuit : 100 RPM, 100 000 TPM
Payant : 500 RPM, 2 millions TPM
Premium : 5 000 RPM, 50 millions TPM

Une limite supplémentaire de 10 000 requêtes par adresse IP et par période de 60 secondes est appliquée afin de prévenir les abus. Les limites sont appliquées par clé et comptabilisées sur une période de 60 secondes, ce qui permet d’aplanir les pics de trafic plutôt que de les mettre en file d’attente. Une requête dépassant la limite renvoie une erreur HTTP 429 et doit être relancée avec un délai exponentiel. Si vous avez besoin de limites supérieures à celles du niveau Premium, ou d’une capacité dédiée sans aucune limite partagée, veuillez contacter Elastic Sales.
Quel modèle d'embedding dois-je choisir ?
keyboard_arrow_down
Commencez par jina-embeddings-v5-text-small pour la recherche de texte : c’est le modèle le plus performant pour les requêtes inférieures à 1 milliard de mots et il gère jusqu’à 32 000 éléments de contexte. Passez à jina-embeddings-v5-text-nano lorsque la latence, le coût ou les performances du matériel périphérique priment sur la précision maximale. Utilisez jina-embeddings-v5-omni-small ou v5-omni-nano pour les images, les fichiers audio, vidéo ou PDF ; leur rendu textuel est identique à celui du modèle de texte correspondant, ce qui vous permet d’ajouter des modalités à un index existant sans réembedding. Utilisez jina-code-embeddings-0.5b ou jina-code-embeddings-1.5b pour le code source. Au sein d’une même famille, la version la plus récente est préférable.
Quelles sont les limites de taille des fichiers image et PDF ?
keyboard_arrow_down
La taille maximale des fichiers est de 5 Mo pour les images et de 8 Mo pour les PDF. Les fichiers plus volumineux seront rejetés et un message d'erreur s'affichera.

Comment obtenir ma clé API ?

video_not_supported

Quelle est la limite de débit ?

Limite de débit
Les limites de débit sont suivies de deux manières : RPM (requêtes par minute) et TPM (tokens par minute). Les limites sont appliquées par IP/clé API et sont déclenchées dès que le seuil RPM ou TPM est atteint. Lorsque vous fournissez une clé API dans l'en-tête de la requête, nous suivons les limites de débit par clé plutôt que par adresse IP.
ProduitPoint de terminaison de l'APIDescriptionarrow_upwardsans clé APIkey_offavec clé API gratuitekeyavec clé API payantekeyavec clé API PremiumkeyLatence moyenneComptage de l'utilisation des tokensDemande autorisée
API de Readerhttps://r.jina.aiConvertir l'URL en texte compatible LLM20 RPM500 RPM500 RPMtrending_up5000 RPM7.9sCompter le nombre de tokens dans la réponse de sortie.GET/POST
API de Readerhttps://s.jina.aiRechercher sur le web et convertir les résultats en texte adapté au LLMblock100 RPM100 RPMtrending_up1000 RPM2.5sChaque demande coûte un nombre fixe de tokens, à partir de 10000 tokensGET/POST
API de reclassementhttps://api.jina.ai/v1/rerankClasser les documents par requêteblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
dépend de la taille de l'entrée
help
Compter le nombre de tokens dans la demande d'entrée.POST
API embeddingshttps://api.jina.ai/v1/embeddingsConvertir du texte/des images en vecteurs de longueur fixeblock100 RPM & 100,000 TPM500 RPM & 2,000,000 TPMtrending_up5,000 RPM & 50,000,000 TPM
ssid_chart
dépend de la taille de l'entrée
help
Compter le nombre de tokens dans la demande d'entrée.POST

Ai-je besoin d’une licence commerciale ?

Auto-vérification de la licence CC BY-NC

play_arrow
Utilisez-vous notre API hébergée ou nos images officielles sur Azure, AWS ou GCP ?
play_arrow
Oui
Aucune licence supplémentaire n'est requise. L'utilisation commerciale est soumise aux conditions d'utilisation : inscrivez-vous et payez via ce site ou la plateforme cloud.
play_arrow
Non
play_arrow
Exploitez-vous vous-même les poids du modèle, dans un produit ou un service commercial ?
play_arrow
Non
Aucun achat requis. Le téléchargement, l'évaluation, l'analyse comparative et l'utilisation à des fins de recherche sont autorisés conformément à toutes les licences sous lesquelles nous publions, à condition d'en mentionner la source.
play_arrow
Oui
play_arrow
De quelle licence dispose le mannequin ? C’est indiqué sur sa page sur Hugging Face.
play_arrow
Apache-2.0
Apache 2.0 autorise l'utilisation commerciale. Aucun achat requis. Ceci couvre nos anciens modèles de génération v1 et v2.
play_arrow
CC BY-NC 4.0
Vous avez besoin d'une licence commerciale. Depuis le 10 août 2026, Elastic en propose une pour les modèles Jina sous la référence Jina On-Prem. Elle couvre les déploiements autogérés, sur site et isolés du réseau, et ne nécessite pas d'abonnement Elasticsearch.
Si vous êtes déjà client d'Elastic, votre équipe commerciale peut l'ajouter à votre contrat existant.
Contactez le service commercial d'Elastic
play_arrow
Licence de recherche Qwen
La licence de recherche n'autorise pas l'utilisation commerciale, et la licence commerciale de nos autres modèles ne s'applique pas à celui-ci. Aucune option commerciale n'est disponible pour ce modèle, que ce soit en auto-hébergement ou via l'API. Veuillez choisir un modèle sous l'une des deux autres licences.
Questions courantes liées à l'API
code
Puis-je utiliser la même clé API pour toutes les API Jina ?
keyboard_arrow_down
Oui. Une seule clé API est valable pour tous les produits de la plateforme de recherche Jina AI, y compris les API Reader, Embeddings, Reranker, Classifier et Segmenter, avec des tokens partagés entre eux.
code
Puis-je surveiller l’utilisation des tokens de ma clé API ?
keyboard_arrow_down
Oui, l'utilisation des tokens peut être surveillée dans l'onglet « Clé API et facturation » en saisissant votre clé API, ce qui vous permet d'afficher l'historique d'utilisation récent et les tokens restants. Si vous êtes connecté au tableau de bord de l'API, ces détails peuvent également être consultés dans l'onglet « Gérer la clé API ».
code
Que dois-je faire si j'oublie ma clé API ?
keyboard_arrow_down
Si vous avez égaré une clé rechargée et souhaitez la récupérer, veuillez contacter le support AT jina.ai avec votre adresse e-mail enregistrée pour obtenir de l'aide. Il est recommandé de vous connecter pour conserver votre clé API en toute sécurité et facilement accessible.
Contact
code
Les clés API expirent-elles ?
keyboard_arrow_down
Non, nos clés API n'ont pas de date d'expiration. Si une clé est compromise, révoquez-la vous-même depuis le tableau de bord de gestion des clés API. La révocation est immédiate. Pour éviter toute interruption de service, émettez d'abord une clé de remplacement. Le solde de tokens restant est conservé sur votre compte et non associé à la clé révoquée. Si vous ne pouvez pas accéder au tableau de bord ou si vous pensez que votre compte est compromis, contactez le support Elastic.
Contact
code
Puis-je transférer des tokens entre des clés API ?
keyboard_arrow_down
Oui, vous pouvez transférer des tokens d'une clé premium vers une autre. Après vous être connecté à votre compte sur le tableau de bord de gestion des clés API, utilisez les paramètres de la clé que vous souhaitez transférer pour déplacer tous les tokens payants restants.
code
Puis-je révoquer ma clé API ?
keyboard_arrow_down
Oui, vous pouvez révoquer votre clé API si vous pensez qu'elle a été compromise. La révocation d'une clé la désactivera immédiatement pour tous les utilisateurs qui l'ont stockée, et tout le solde restant et les propriétés associées seront définitivement inutilisables. Si la clé est une clé premium, vous avez la possibilité de transférer le solde restant payé vers une autre clé avant la révocation. Notez que cette action ne peut pas être annulée. Pour révoquer une clé, accédez aux paramètres de clé dans le tableau de bord de gestion des clés API.
code
Pourquoi la première demande de certains modèles est-elle lente ?
keyboard_arrow_down
Cela est dû au fait que notre architecture sans serveur décharge certains modèles pendant les périodes de faible utilisation. La requête initiale active ou « réchauffe » le modèle, ce qui peut prendre quelques secondes. Après cette activation initiale, les requêtes suivantes sont traitées beaucoup plus rapidement.
code
Mes données API sont-elles utilisées pour entraîner vos modèles ?
keyboard_arrow_down
Non. Nous n'utilisons jamais vos requêtes API, entrées ou sorties pour entraîner nos modèles d'embedding, de reranker ou tout autre modèle. Vos données vous appartiennent.
code
Quelles sont les limites de débit des API Jina ?
keyboard_arrow_down
Des limites de débit s'appliquent par clé API :

Gratuit : 100 RPM, 100 000 TPM
Payant : 500 RPM, 2 millions TPM
Premium : 5 000 RPM, 50 millions TPM

Une limite de 10 000 requêtes par 60 secondes est également appliquée par adresse IP. Les limites varient selon le point de terminaison ; consultez le tableau des limites de débit ci-dessus pour connaître les valeurs par point de terminaison.
code
Existe-t-il des limites de taille de lot pour les API ?
keyboard_arrow_down
Il n'y a aucune limite de taille de lot pour les API Embeddings et Reranker. Vous pouvez envoyer autant d'éléments ou de documents que nécessaire par requête. Les deux API traitent les entrées par lots en interne, en fonction du nombre de tokens, pour une utilisation optimale du GPU.
code
Les API Jina sont-elles la même chose que les modèles Jina au sein d'Elastic ?
keyboard_arrow_down
Non, il s'agit de trois solutions distinctes. Les API Jina disponibles sur ce site sont en libre-service et fonctionnent avec un paiement à l'utilisation via une clé API Jina. Elastic Inference Service (EIS) exécute les modèles Jina au sein d'Elastic Cloud et est facturé via votre abonnement Elastic, sans aucune infrastructure à gérer de votre part. Jina On-Prem est une licence commerciale, vendue par Elastic sous sa propre référence depuis le 10 août 2026, permettant d'exécuter les modèles dans votre propre infrastructure autogérée, sur site ou isolée du réseau. Pour les solutions EIS et On-Prem, veuillez contacter le service commercial d'Elastic.
Questions courantes liées à la facturation
attach_money
La facturation est-elle basée sur le nombre de phrases ou de demandes ?
keyboard_arrow_down
Notre modèle de tarification est basé sur le nombre total de tokens traités, ce qui donne aux utilisateurs la possibilité d'attribuer ces tokens à un nombre illimité de phrases, offrant ainsi une solution rentable pour diverses exigences d'analyse de texte.
attach_money
Existe-t-il un essai gratuit disponible pour les nouveaux utilisateurs ?
keyboard_arrow_down
Oui. Les nouveaux utilisateurs reçoivent une clé API générée automatiquement ainsi que des tokens gratuits utilisables avec tous nos modèles. Une fois ces tokens gratuits épuisés, vous pouvez en acheter d'autres pour cette clé dans l'onglet « Acheter des tokens ».
attach_money
Les tokens sont-ils facturés pour les demandes ayant échoué ?
keyboard_arrow_down
Non, les tokens ne sont pas déduits pour les demandes ayant échoué.
attach_money
Quels moyens de paiement sont acceptés ?
keyboard_arrow_down
Les paiements sont traités via Stripe, prenant en charge diverses méthodes de paiement, notamment les cartes de crédit, Google Pay et PayPal, pour votre commodité.
attach_money
La facturation est-elle disponible pour les achats de tokens ?
keyboard_arrow_down
Pour les achats de tokens en libre-service, Stripe envoie une facture à l'adresse e-mail associée à votre compte Stripe au moment de l'achat. Si vous avez besoin d'un bon de commande, d'un contrat négocié, de documents d'approvisionnement ou d'une facturation consolidée, traités par Elastic et non par Stripe : contactez le service commercial d'Elastic.
attach_money
Comment puis-je acheter une licence commerciale plutôt que des tokens API ?
keyboard_arrow_down
L'achat de tokens sur ce site vous permet d'utiliser les API Jina hébergées. Il ne vous autorise pas à exécuter les poids du modèle sur votre propre infrastructure. Pour cela, Elastic propose une licence commerciale distincte depuis le 10 août 2026, facturée annuellement et non par token. Contactez le service commercial d'Elastic pour obtenir un devis.
attach_money
Puis-je payer par facture ou bon de commande plutôt que par carte ?
keyboard_arrow_down
Les achats de tokens en libre-service sont traités par Stripe et facturés automatiquement à l'adresse e-mail associée à votre compte Stripe. Pour les commandes, les processus d'approvisionnement ou les volumes supérieurs à la capacité de recharge en libre-service, veuillez contacter Elastic Sales.
attach_money
J'ai payé, mais mon solde ou ma limite de débit n'a pas changé. Que dois-je vérifier ?
keyboard_arrow_down
Le solde et les limites de débit sont liés à une clé API, et non au compte. Par conséquent, vérifiez d'abord la clé elle-même, et non la page du compte : saisissez-la dans l'onglet « Clé API et facturation » et vérifiez le solde et le niveau. Si le compte possède plusieurs clés, les tokens sont associés à la clé rechargée, qui peut différer de celle utilisée par votre application. La mise à jour du niveau peut prendre un peu de temps après le paiement. Si le solde affiché est correct mais que la limite reste celle du niveau précédent, contactez l'assistance.
attach_money
Comment puis-je annuler, arrêter le rechargement automatique ou supprimer un mode de paiement enregistré ?
keyboard_arrow_down
La facturation en libre-service est gérée depuis le portail client, accessible via l'onglet « Clé API et facturation ». Vous pouvez y désactiver le rechargement automatique et supprimer les moyens de paiement enregistrés. La désactivation du rechargement automatique empêche les prélèvements futurs, mais le solde déjà utilisé reste disponible. Si vous souhaitez également supprimer votre compte et ses données, ou demander un remboursement, veuillez adresser votre demande au support. La suppression de compte est traitée manuellement et prend quelques jours ouvrables. Vous recevrez une confirmation écrite une fois la suppression effectuée.
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.