Aperçu
jina-reranker-v1-tiny-en est un reranker cross-encodeur anglais de 33M paramètres — le plus petit de la famille v1 de Jina. Grâce à une distillation de connaissances agressive, il conserve 92,5 % de la précision du modèle de base tout en traitant les documents cinq fois plus vite et en utilisant 13 % de mémoire en moins que la variante turbo. Il est conçu pour l'edge computing, les applications mobiles et les systèmes de recherche à fort débit avec des budgets de latence stricts.
Méthodes
Le modèle emploie une architecture allégée de quatre couches basée sur JinaBERT avec des encodings positionnels ALiBi bidirectionnels symétriques. Son développement exploite la distillation de connaissances depuis jina-reranker-v1-base-en de 137M paramètres, qui sert de modèle enseignant. Le modèle élève apprend des comportements de classement optimaux sans exiger d'amples données d'entraînement du monde réel, en égalant les distributions de classement douces de l'enseignant tout en n'utilisant que 33M paramètres. La conception en quatre couches et les dimensions cachées réduites permettent l'accélération de 5× par rapport au modèle de base. Le modèle prend en charge un contexte de 1 024 tokens avec un découpage automatique pour les documents plus longs.
Performance
Sur BEIR, le modèle atteint un NDCG@10 de 48,54, conservant 92,5 % des performances du modèle de base (52,45) tout en ne faisant qu'un quart de sa taille. Dans les benchmarks RAG de LlamaIndex, il maintient un taux de rappel de 83,16 %, rivalisant de près avec des modèles plus grands tout en traitant les documents nettement plus vite. Le débit est presque cinq fois plus rapide que le modèle de base, avec 13 % d'utilisation mémoire en moins que la variante turbo. Ces métriques rivalisent ou dépassent des modèles bien plus grands comme mxbai-rerank-base-v1 (184M) et bge-reranker-base (278M). Le compromis performance-taille le rend particulièrement adapté aux déploiements aux ressources limitées.
Conseils
Priorisez les scénarios où la vitesse de traitement et l'efficacité des ressources sont critiques : edge computing, applications mobiles et systèmes de recherche à fort débit avec des budgets de latence stricts. Pour les applications exigeant une précision de classement maximale absolue, le modèle de base ou jina-reranker-v3.5 est préférable. Le modèle requiert une GPU compatible CUDA pour des performances optimales, mais fonctionne sur un matériel moins puissant que ses homologues plus grands. Il s'intègre aux bases de données vectorielles et frameworks RAG majeurs et est disponible via l'API Reranker de Jina et AWS SageMaker. Le modèle est uniquement anglais ; pour les applications multilingues, utilisez jina-reranker-v2-base-multilingual ou jina-reranker-v3.5. Lors de l'affinage pour des domaines spécifiques, équilibrez soigneusement la qualité des données d'entraînement avec l'architecture compacte du modèle pour préserver ses caractéristiques de performance.





