Jina AI annonce de nouveaux modèles dans sa famille de modèles reranker à la pointe de la technologie, désormais disponibles sur AWS Sagemaker et Hugging Face : jina-reranker-v1-turbo-en et jina-reranker-v1-tiny-en. Ces modèles privilégient la vitesse et la taille tout en maintenant des performances élevées sur les benchmarks standards, offrant un processus de reclassement plus rapide et plus économe en mémoire pour les environnements où le temps de réponse et l'utilisation des ressources sont critiques.



Reranker Turbo et Tiny sont optimisés pour des temps de réponse ultra-rapides dans les applications de recherche d'information. Comme nos modèles d'embedding, ils utilisent l'architecture JinaBERT, une variante de l'architecture BERT améliorée avec une variante symétrique bidirectionnelle d'ALiBi. Cette architecture permet de prendre en charge de longues séquences de texte, nos modèles acceptant jusqu'à 8 192 tokens, idéal pour l'analyse approfondie de documents plus volumineux et des requêtes complexes nécessitant une compréhension détaillée du langage.
Les modèles Turbo et Tiny s'appuient sur les enseignements tirés de Jina Reranker v1. Le reclassement peut être un goulot d'étranglement majeur pour les applications de recherche d'information. Les applications de recherche traditionnelles sont une technologie très mature dont les performances sont bien comprises. Les rerankers ajoutent beaucoup de précision à la recherche textuelle, mais les modèles d'IA sont volumineux et peuvent être lents et coûteux à exécuter.
Beaucoup d'utilisateurs préféreraient un modèle plus petit, plus rapide et moins cher, même si cela se fait au détriment de la précision. Avoir un seul objectif – le reclassement des résultats de recherche – permet de rationaliser le modèle et d'offrir aux utilisateurs des performances compétitives dans des modèles beaucoup plus compacts. En utilisant moins de couches cachées, nous accélérons le traitement et réduisons la taille du modèle. Ces modèles coûtent moins cher à exécuter, et leur plus grande vitesse les rend plus utiles pour les applications qui ne peuvent pas tolérer beaucoup de latence, tout en conservant presque toutes les performances des modèles plus grands.
Dans cet article, nous vous montrerons l'architecture de Reranker Turbo et Reranker Tiny, mesurerons leurs performances et vous montrerons comment les utiliser.
tagArchitecture rationalisée
Jina Reranker Turbo (jina-reranker-v1-turbo-en) utilise une architecture à six couches, avec un total de 37,8 millions de paramètres, contrairement aux 137 millions de paramètres et douze couches du modèle reranker de base jina-reranker-v1-base-en. Cela représente une réduction de trois quarts de la taille du modèle et jusqu'à un triplement de la vitesse de traitement.
Reranker Tiny (jina-reranker-v1-tiny-en) utilise quatre couches avec 33 millions de paramètres, offrant un traitement parallèle encore plus important et des vitesses plus rapides – presque cinq fois plus rapide que le modèle Reranker de base – tout en économisant 13 % des coûts de mémoire par rapport au modèle Turbo.

tagDistillation de connaissances
Nous avons entraîné Reranker Turbo et Tiny en utilisant la distillation de connaissances. C'est une technique qui utilise un modèle d'IA existant pour en entraîner un autre à reproduire son comportement. Au lieu d'utiliser des sources de données externes, nous utilisons un modèle existant pour générer des données d'entraînement. Nous avons utilisé le modèle Jina Reranker de base pour classer des collections de documents, puis nous avons utilisé ces résultats pour entraîner Turbo et Tiny. De cette façon, nous pouvons intégrer beaucoup plus de données dans le processus d'entraînement car nous ne sommes pas limités par les données du monde réel disponibles.
C'est un peu comme un étudiant qui apprend d'un professeur : Le modèle déjà entraîné et hautement performant – le modèle Jina Reranker Base – « enseigne » aux modèles Jina Turbo et Jina Tiny non entraînés en générant de nouvelles données d'entraînement. Cette technique est largement utilisée pour créer des petits modèles à partir de grands modèles. Dans le meilleur des cas, la différence de performance entre le modèle « professeur » et l'« élève » peut être très faible.
tagÉvaluation sur BEIR
Les avantages de la rationalisation et de la distillation des connaissances se font au prix d'une perte relativement faible de qualité de performance. Sur le benchmark BEIR pour la recherche d'information, jina-reranker-v1-turbo-en obtient juste en dessous de 95 % de la précision de jina-reranker-v1-base-en, et jina-reranker-v1-tiny-en obtient 92,5 % du score du modèle de base.
Tous les modèles Jina Reranker sont compétitifs avec d'autres modèles reranker populaires, dont la plupart sont de taille beaucoup plus importante.
| Model | BEIR Score (NDCC@10) | Parameters |
|---|---|---|
| Jina Reranker models | ||
| jina-reranker-v1-base-en | 52.45 | 137M |
| jina-reranker-v1-turbo-en | 49.60 | 38M |
| jina-reranker-v1-tiny-en | 48.54 | 33M |
| Other reranking models | ||
mxbai-rerank-base-v1 |
49.19 | 184M |
mxbai-rerank-xsmall-v1 |
48.80 | 71M |
ms-marco-MiniLM-L-6-v2 |
48.64 | 23M |
bge-reranker-base |
47.89 | 278M |
ms-marco-MiniLM-L-4-v2 |
47.81 | 19M |
NDCC@10 : Scores calculés en utilisant le Gain Cumulatif Actualisé Normalisé pour les 10 premiers résultats.

Seuls MiniLM-L6 (ms-marco-MiniLM-L-6-v2) et MiniLM-L4 (ms-marco-MiniLM-L-4-v2) ont des tailles et des vitesses comparables, avec jina-reranker-v1-turbo-en et jina-reranker-v1-tiny-en qui obtiennent des performances comparables ou nettement meilleures.
Nous obtenons des résultats similaires sur le LlamaIndex RAG Benchmark. Nous avons testé les trois Jina Rerankers dans une configuration RAG en utilisant trois modèles d'embedding pour la recherche vectorielle (jina-embeddings-v2-base-en, bge-base-en-v1.5, et Cohere-embed-english-v3.0) et avons fait la moyenne des scores.
| Reranker Model | Avg. Hit Rate | Avg. MRR |
|---|---|---|
| Jina Reranker models | ||
| jina-reranker-v1-base-en | 0.8439 | 0.7006 |
| jina-reranker-v1-turbo-en | 0.8351 | 0.6498 |
| jina-reranker-v1-tiny-en | 0.8316 | 0.6761 |
| Other reranking models | ||
mxbai-rerank-base-v1 |
0.8105 | 0.6583 |
mxbai-rerank-xsmall-v1 |
0.8193 | 0.6673 |
ms-marco-MiniLM-L-6-v2 |
0.8052 | 0.6121 |
bge-reranker-base |
0.8175 | 0.6480 |
ms-marco-MiniLM-L-4-v2 |
0.8246 | 0.6354 |
MRR : Mean Reciprocal Rank
Pour les tâches de génération augmentée par récupération (RAG), les pertes de qualité des résultats sont encore moins importantes que sur le benchmark BEIR de pure recherche d'informations. Et lorsque l'on compare les performances RAG à la vitesse de traitement, nous constatons que seul ms-marco-MiniLM-L-4-v2 offre un débit significativement plus élevé, au prix d'une perte importante de qualité des résultats.

tagÉconomies de coûts sur AWS
L'utilisation de Reranker Turbo et Reranker Tiny permet de réaliser d'importantes économies pour les utilisateurs AWS et Azure qui paient pour l'utilisation de la mémoire et le temps CPU. Bien que le niveau d'économies varie selon les cas d'utilisation, la réduction d'environ 75 % de l'utilisation de la mémoire correspond directement à une économie de 75 % pour les systèmes cloud facturant la mémoire.
De plus, le débit plus rapide signifie que vous pouvez exécuter plus de requêtes sur des instances AWS moins coûteuses.
tagPour commencer
Les modèles Jina Reranker sont faciles à utiliser et à intégrer dans vos applications et flux de travail. Pour commencer, vous pouvez visiter la page API Reranker pour voir comment utiliser notre service et obtenir 1 million de jetons gratuits pour l'essayer vous-même.

Nos modèles sont également disponibles sur AWS SageMaker. Pour plus d'informations, consultez notre tutoriel sur la configuration d'un système de génération augmentée par récupération sur AWS.


Les modèles Jina Reranker sont également disponibles en téléchargement sous la licence Apache 2.0 sur Hugging Face :








