Aperçu
jina-reranker-v1-base-en est un reranker cross-encodeur anglais de 137M paramètres qui affine les résultats de recherche en effectuant une analyse au niveau des tokens des paires requête-document. Il apporte une amélioration de 20 % de la précision de recherche par rapport à la recherche vectorielle de référence, en faisant le cheval de bataille de la première génération de rerankers de Jina. Il est désormais remplacé par les familles multilingues v2 et listwise v3.
Méthodes
Le modèle emploie une architecture de cross-attention basée sur BERT (12 couches, 12 têtes d'attention, 768 dimensions cachées, 137M paramètres) qui diffère fondamentalement des approches basées sur les embeddings. Au lieu de comparer des embeddings de documents précalculés, il effectue des interactions dynamiques au niveau des tokens entre la requête et le document, capturant les nuances contextuelles que la similarité cosinus manque. La fenêtre de contexte de 1 024 tokens prend en charge le découpage automatique et le max-pooling à travers les segments pour les documents plus longs. L'entraînement a utilisé une perte contrastive sur des paires de pertinence requête-document avec minage de négatifs difficiles. Le modèle était le premier reranker de Jina et a établi le modèle pour les variantes turbo et tiny par distillation de connaissances.
Performance
Le modèle atteint 8 % de taux de rappel supplémentaires et une amélioration de 33 % du rang réciproque moyen par rapport à la recherche vectorielle de référence. Sur BEIR, il obtient un NDCG@10 moyen de 0,5588, dépassant BGE (0,5032), BCE (0,4969) et Cohere (0,5141). Sur le benchmark LoCo pour la compréhension de contexte long, il marque 0,873, nettement en avance sur la concurrence. Il montre une force particulière sur le contenu technique : 0,996 sur les abstracts QASPER et 0,962 sur l'analyse de rapports gouvernementaux, bien que le rendement soit moindre (0,466) sur les tâches de résumés de réunions. La latence évolue avec la longueur du document : 156 ms pour 256 tokens, 7 068 ms pour 4 096 tokens avec une requête de 512 tokens.
Conseils
Mettez en place un pipeline en deux étapes : la recherche vectorielle (p. ex. jina-embeddings-v5-text-small) fournit les candidats initiaux, puis ce modèle re-classe les 100–200 premiers pour la précision. Le modèle est uniquement anglais — pour les applications multilingues, utilisez jina-reranker-v2-base-multilingual ou jina-reranker-v3.5. Il exige du matériel compatible CUDA pour le débit de production. Pour les nouveaux projets, préférez jina-reranker-v3.5 (multilingue, listwise, contexte 131K, 63,20 BEIR NDCG@10). Le modèle est disponible via l'API Reranker de Jina, AWS SageMaker et Hugging Face. Lors de l'intégration avec des systèmes RAG, ajustez le nombre de documents envoyés pour le re-classement selon les besoins de latence — 100–200 documents équilibrent généralement qualité et vitesse.










