Aperçu
jina-reranker-v1-turbo-en est un reranker cross-encodeur anglais de 37,8M paramètres qui délivre 95 % de la précision du modèle de base tout en traitant les documents trois fois plus vite et en utilisant 75 % de mémoire en moins. Il a été conçu pour les systèmes de recherche de production où le compromis qualité-latence des cross-encodeurs complets était impraticable, offrant une voie pratique vers l'affinement de recherche à l'échelle.
Méthodes
Le modèle compresse l'architecture BERT de 12 couches du reranker de base en un design à six couches avec 37,8M paramètres (contre 137M pour base). Il maintient le mécanisme central de cross-attention basé sur BERT pour les interactions au niveau des tokens entre requête et document, mais optimise la vitesse par la réduction du nombre de couches et une allocation efficace des paramètres. L'entraînement utilise la distillation de connaissances : le modèle de base plus grand agit comme enseignant, guidant la variante turbo pour correspondre à son comportement de classement avec moins de paramètres. Le modèle prend en charge des séquences jusqu'à 8 192 tokens grâce aux encodings positionnels ALiBi, permettant une analyse documentaire approfondie tout en maintenant une inférence rapide.
Performance
Sur BEIR, la variante turbo atteint un NDCG@10 de 49,60, conservant 95 % des performances du modèle de base (52,45) tout en dépassant bge-reranker-base (47,89, 278M paramètres). Dans les applications RAG, elle maintient un taux de rappel de 83,51 % et un MRR de 0,6498. L'avantage de vitesse est substantiel : trois fois plus rapide que le modèle de base, avec un débit qui évolue quasi linéairement avec la réduction du nombre de paramètres. Les exigences mémoire chutent de 550MB (base) à 150MB (turbo), permettant le déploiement sur des instances plus petites et des économies de coût significatives dans les environnements cloud. La dégradation des performances est minimale sur la plupart des tâches, avec des scores légèrement inférieurs sur des scénarios de classement extrêmement nuancés.
Conseils
Mettez en place un pipeline en deux étapes : la recherche vectorielle fournit les candidats initiaux, puis ce modèle re-classe les 100–200 premiers. Le point optimal pour la plupart des applications est de re-classer 100–200 candidats par requête, équilibrant qualité et vitesse. Le modèle est uniquement anglais ; pour les applications multilingues, utilisez jina-reranker-v2-base-multilingual ou jina-reranker-v3.5. Il exige du matériel compatible CUDA, mais fonctionne sur des instances plus petites que le modèle de base (150MB contre 550MB de mémoire GPU). Disponible via Jina Reranker API et AWS SageMaker. Pour les nouveaux projets, jina-reranker-v3.5 (multilingue, listwise, contexte 131K) est le choix recommandé. Lorsque la latence est la contrainte principale, l'avantage de vitesse 3× de ce modèle le rend adapté aux applications de recherche en temps réel.





