Réglage automatique

Dites-nous simplement dans quel domaine vous souhaitez que vos embeddings excellent, et nous vous fournirons automatiquement un modèle d'embedding prêt à l'emploi et affiné pour ce domaine.

Qu’est-ce que le réglage automatique ?

Il existe trois manières de spécifier vos besoins : une instruction générale, une URL ou une description du document de requête. Choisissez-en un.
Sélectionnez un modèle d'embedding de base
Le réglage fin vous permet de prendre un modèle pré-entraîné et de l'adapter à une tâche ou un domaine spécifique en l'entraînant sur un nouvel ensemble de données. En pratique, trouver des données d’entraînement efficaces n’est pas simple pour de nombreux utilisateurs. Un entraînement efficace nécessite plus que la simple introduction de fichiers PDF bruts et HTML dans le modèle ; et il est difficile de bien faire les choses. Le réglage automatique résout ce problème en générant automatiquement des données d'entraînement efficaces à l'aide d'un pipeline d'agents LLM avancé ; et affiner le modèle dans un flux de travail ML. Vous pouvez le considérer comme une combinaison de génération de données synthétiques et d'AutoML, il vous suffit donc de décrire votre domaine cible en langage naturel et de laisser notre système faire le reste.
Le réglage automatique contient la promesse auto-magique de fournir des embeddings affinés pour n'importe quel domaine de votre choix. Mais cela fonctionne-t-il vraiment? C'est un doute assez raisonnable. Nous l'avons testé sur une variété de domaines et de modèles de base pour le savoir. Découvrez les résultats cueillis aux cerises et au citron ci-dessous.
Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-en
Moy. amélioration
2%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.505 0.532 5%
MAP
0.352 0.389 10%
MRR
0.352 0.389 10%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de tollefj/norwegian-nli-triplets
NDCG
0.852 0.867 2%
MAP
0.800 0.820 2%
MRR
0.800 0.820 2%
Données synthétiques générées
Total
4648
Entraînement
4480
Validation
168

Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-en
Moy. amélioration
6%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.672 0.755 12%
MAP
0.567 0.675 19%
MRR
0.567 0.675 19%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de mteb/askubuntudupquestions-reranking
NDCG
0.698 0.722 3%
MAP
0.515 0.549 6%
MRR
0.666 0.712 7%
Données synthétiques générées
Total
616
Entraînement
448
Validation
168

Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-en
Moy. amélioration
9%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.727 0.861 18%
MAP
0.640 0.814 27%
MRR
0.640 0.814 27%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de mteb/scidocs-reranking
NDCG
0.773 0.822 6%
MAP
0.575 0.651 13%
MRR
0.823 0.884 7%
Données synthétiques générées
Total
616
Entraînement
448
Validation
168

Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-zh
Moy. amélioration
1%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.718 0.785 9%
MAP
0.629 0.717 14%
MRR
0.629 0.717 14%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de C-MTEB/CMedQAv2-reranking
NDCG
0.938 0.948 1%
MAP
0.912 0.926 2%
MRR
0.920 0.933 1%
Données synthétiques générées
Total
616
Entraînement
448
Validation
168

Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-en
Moy. amélioration
6%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.543 0.579 7%
MAP
0.402 0.452 12%
MRR
0.402 0.452 12%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de nc33/triplet_sbert_law2 (machine-translated to dutch)
NDCG
0.904 0.948 5%
MAP
0.870 0.930 7%
MRR
0.870 0.930 7%
Données synthétiques générées
Total
9128
Entraînement
8960
Validation
168

Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-code
Moy. amélioration
-4%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.671 0.640 -5%
MAP
0.569 0.525 -8%
MRR
0.569 0.525 -8%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de mteb/stackoverflowdupquestions-reranking
NDCG
0.640 0.621 -3%
MAP
0.530 0.505 -5%
MRR
0.555 0.532 -4%
Données synthétiques générées
Total
616
Entraînement
448
Validation
168

Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-code
Moy. amélioration
-4%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.632 0.711 13%
MAP
0.517 0.622 20%
MRR
0.517 0.622 20%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de mteb/stackoverflowdupquestions-reranking
NDCG
0.640 0.619 -3%
MAP
0.530 0.504 -5%
MRR
0.555 0.525 -5%
Données synthétiques générées
Total
616
Entraînement
448
Validation
168

Modèle de base pour un réglage fin
jinaai/jina-embeddings-v2-base-en
Moy. amélioration
1%

Instruction de domaine
Performances sur la validation synthétique définie avant et après le réglage fin
NDCG
0.646 0.729 13%
MAP
0.535 0.644 20%
MRR
0.535 0.644 20%
Performances sur un ensemble de tests retenu avant et après le réglage fin
Testé sur 50 échantillons aléatoires de mteb/askubuntudupquestions-reranking
NDCG
0.645 0.650 1%
MAP
0.452 0.462 2%
MRR
0.606 0.605 -0%
Données synthétiques générées
Total
616
Entraînement
448
Validation
168

API de réglage automatique

Obtenez des embeddings affinés pour le domaine de votre choix.


Utilisez r.jina.ai pour lire une URL et récupérer son contenu
Utilisez s.jina.ai pour rechercher sur le Web et obtenir le SERP
Ajoutez mcp.jina.ai comme serveur MCP pour accéder à notre API dans les LLM


Demande
GET
curl "https://r.jina.ai/https://www.example.com"


Limite de débit
Les limites de débit sont suivies de deux manières : RPM (requêtes par minute) et TPM (tokens par minute). Les limites sont appliquées par IP/clé API et sont déclenchées dès que le seuil RPM ou TPM est atteint. Lorsque vous fournissez une clé API dans l'en-tête de la requête, nous suivons les limites de débit par clé plutôt que par adresse IP.
ProduitPoint de terminaison de l'APIDescriptionsans clé APIavec clé API gratuiteavec clé API payanteavec clé API PremiumLatence moyenneComptage de l'utilisation des tokensDemande autorisée
API de Readerhttps://r.jina.aiConvertir l'URL en texte compatible LLM20 RPM500 RPM500 RPM5000 RPM7.9sCompter le nombre de tokens dans la réponse de sortie.GET/POST
API de Readerhttps://s.jina.aiRechercher sur le web et convertir les résultats en texte adapté au LLM100 RPM100 RPM1000 RPM2.5sChaque demande coûte un nombre fixe de tokens, à partir de 10 000 tokensGET/POST
API de reclassementhttps://api.jina.ai/v1/rerankClasser les documents par requête100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
dépend de la taille de l'entrée
Compter le nombre de tokens dans la demande d'entrée.POST
API embeddingshttps://api.jina.ai/v1/embeddingsConvertir du texte/des images en vecteurs de longueur fixe100 RPM & 100,000 TPM500 RPM & 2,000,000 TPM5,000 RPM & 50,000,000 TPM
dépend de la taille de l'entrée
Compter le nombre de tokens dans la demande d'entrée.POST
Questions courantes liées à la facturation