Graphique d'E/S
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
BEIR
62.10
Parameters
597M
Rank by score
4 / 21
Pareto front
Behind it
Distribution des valeurshelp_outlineAUC 0.8396
Corpus
Paires de traduction
Recherche documentaire
Code
Liées62.2%
Négatif difficile18.2%
Non liées9.5%
Seuils recommandés
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
équilibré · -0.008
AUC
0.8396
Plafond de bruit
0.414
Décrochage du rappel
-0.185
Paires mesurées
119 / 2,856
Score par ranghelp_outline
Score moyen à chaque position de rang
Ce qui gagne le rang 1help_outline
Une correspondance correcte gagne 45 % des 119 requêtes
Sensibilité au poolhelp_outline
Position dans la liste0.161
Taille du pool0.088
Difficulté du remplissage0.015
Plus grand écart de score sur une même paire
Choisissez les modèles à comparer
Publications (1)
Aperçu
jina-reranker-v3 est un reranker de documents multilingue de 0,6 milliard de paramètres, qui introduit une nouvelle architecture d'interaction « last but not late ». Contrairement à l'encodage séparé avec correspondance multi-vecteurs de ColBERT, ce modèle effectue une auto-attention causale entre la requête et les documents au sein de la même fenêtre contextuelle, permettant ainsi des interactions inter-documents riches avant d'extraire les embeddings contextuels du dernier token de chaque document. Basé sur Qwen3-0.6B avec 28 couches de transformeur et un projecteur MLP léger (1024→512→256), il traite jusqu'à 64 documents simultanément dans un contexte de 131K tokens. Le modèle atteint des performances BEIR de pointe avec 61,94 nDCG-10, tout en étant 10 fois plus compact que les rerankers génératifs listwise.
Méthodes
L'apprentissage progressif en trois étapes avec perte multi-objectif combine InfoNCE, perte dispersive (0,45), perte de double appariement (0,85) et perte de similarité (0,85). L'étape 1 utilise un réglage fin LoRA (r = 16, α = 32) sur des jeux de données spécifiques à un domaine, notamment BGE-M3 et Cornstack, avec 16 documents par requête. L'étape 2 étend le contexte à 8 192 tokens et extrait des négatifs difficiles (hard negatives) issus de plusieurs systèmes de recherche, jusqu'à 25 négatifs à τ = 0,05. L'étape 3 fusionne des modèles spécialisés avec des pondérations de 0,25 à 0,65. Les tokens spéciaux doc_emb et query_emb marquent les positions d'extraction des embeddings. L'apprentissage utilise des prompts structurés avec des rôles système/utilisateur/assistant, plaçant la requête au début et à la fin pour une attention bidirectionnelle.
Performance
Atteint 61,94 nDCG-10 sur BEIR, le plus élevé parmi tous les rerankers évalués et une amélioration de 4,88 % par rapport à jina-reranker-v2. Excellent en récupération multi-sauts avec 78,56 sur HotpotQA, la vérification des faits atteignant 93,95 sur FEVER. Les performances multilingues atteignent 66,50 sur MIRACL sur 18 langues, avec l'arabe à 78,69 et le thaï à 81,06. La récupération de code atteint 63,28 sur CoIR. Surpasse 1,5B mxbai-rerank-large (61,44) avec 2,5 fois moins de paramètres. Affiche une amélioration de 5,43 % par rapport à bge-reranker-v2-m3 de même échelle. Relativement stable dans tous les ordres de documents : aléatoire (62,54), décroissant (61,94), croissant (61,52).
Conseils
Utilisez un modèle de prompt structuré avec des rôles système/utilisateur/assistant et des tokens spéciaux pour l'extraction des embeddings. Traitez jusqu'à 64 documents par passe avant pour les collections dépassant le contexte de 131K. Optimal avec des documents classés aléatoirement ou par ordre de pertinence décroissante. Exploitez la capacité d'interaction entre documents pour les tâches de classement comparatif. Pour les applications multilingues, le modèle offre un solide transfert zero-shot dans 18 langues. Mettez en œuvre le traitement par lots pour les grands ensembles de documents, en conservant la cohérence des embeddings de requêtes entre les lots. Envisagez les embeddings de sortie à 256 dimensions pour un calcul de similarité efficace. Idéal pour les applications exigeant à la fois qualité de classement et efficacité d'inférence, notamment le raisonnement multi-sauts et les tâches de vérification des faits.
Blogs qui mentionnent ce modèle








