Graphique d'E/S
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
BEIR
63.20
Parameters
597M
Rank by score
1 / 21
Pareto front
On it
Distribution des valeurshelp_outlineAUC 0.9596
Corpus
Paires de traduction
Recherche documentaire
Code
Liées89.1%
Négatif difficile23.7%
Non liées10.9%
Seuils recommandés
FPR 0.1 · 0.107
FPR 0.01 · 0.438
FPR 0.001 · 0.635
FPR 0.0001 · 0.690
équilibré · 0.070
AUC
0.9596
Plafond de bruit
0.621
Décrochage du rappel
-0.039
Paires mesurées
119 / 2,856
Score par ranghelp_outline
Score moyen à chaque position de rang
Ce qui gagne le rang 1help_outline
Une correspondance correcte gagne 66 % des 119 requêtes
Sensibilité au poolhelp_outline
Position dans la liste0.185
Taille du pool0.057
Difficulté du remplissage0.034
Plus grand écart de score sur une même paire
Choisissez les modèles à comparer
Publications (1)
Aperçu
jina-reranker-v3.5 est un reranker de documents multilingue listwise de 0,6 milliard de paramètres. Il s'agit d'une mise à jour directe de jina-reranker-v3. Il conserve la même interface listwise LBNL (last-but-not-late) – classant une requête par rapport à de nombreux candidats en une seule passe avant – tout en améliorant la robustesse du domaine, le classement des données structurées, la recherche multilingue et l'efficacité de l'inférence. Basé sur Qwen3-0.6B avec 28 couches utilisant une attention hybride 3L2G (couches à fenêtre glissante, fenêtre de 1024, entrelacées avec des couches d'attention globale et une couche globale terminale fixée requise par LBNL) et un projecteur MLP léger (1024→512→512), il prend en charge jusqu'à 131K tokens de contexte et classe les documents conjointement via une auto-attention causale et un score cosinus. Il atteint 63,20 nDCG-10 sur BEIR — au-dessus du Qwen3-Reranker 4B avec environ 7 fois moins de paramètres — tout en s'exécutant 1,22×–1,56× plus rapidement que v3 sur des contextes courts à longs.
Méthodes
jina-reranker-v3.5 conserve l'architecture de recherche par liste LBNL (Last-but-not-late) de jina-reranker-v3 : la requête et les candidats partagent une même fenêtre de contexte, et un plongement contextuel est lu à partir du dernier jeton de chaque document. Cependant, l'attention globale uniforme est remplacée par un schéma hybride 3L2G : au sein de chaque groupe de couches, des couches d'attention à fenêtre glissante (fenêtre 1024) sont entrelacées avec des couches d'attention globale, et une couche globale terminale est fixée conformément aux exigences de LBNL. Ceci réduit le coût de l'attention sur les longues listes de candidats tout en préservant l'interaction entre les documents. Le modèle est entraîné avec auto-distillation pour une recherche robuste au domaine, et sa tête de projection MLP produit des plongements de dimension 512 (1024→512→512).
Performance
Dans le cadre d'un protocole unifié top-100, avec jina-embeddings-v5-text-small comme première étape, jina-reranker-v3.5 obtient 63,20 nDCG-10 sur BEIR, 74,11 sur MIRACL, 70,95 sur RTEB et 48,3 sur Struct-IR, surpassant ainsi jina-reranker-v3 (62,10 / 72,20 / 68,01 / 38,7) sur tous les axes. Son score BEIR devance celui du Qwen3-Reranker 4B (62,28) avec environ sept fois moins de paramètres et se place en tête de tous les rerankers de la classe 0,6B évalués. Les gains relatifs par rapport à la v3 incluent +1,10 sur BEIR, +2,6 % sur MIRACL, +4,3 % sur RTEB (avec des progrès importants sur la recherche juridique) et +24,8 % sur le classement de données structurées (Struct-IR). L'inférence listwise s'exécute 1,22×–1,56× plus rapidement que la v3, des contextes courts aux contextes longs (A100, FlashAttention-2).
Conseils
jina-reranker-v3.5 remplace directement jina-reranker-v3 : le schéma de requête restant inchangé, il suffit de modifier la chaîne de modèle de jina-reranker-v3 à jina-reranker-v3.5. Il classe une requête par rapport à la liste complète des candidats en un seul appel : transmettez les documents via le point de terminaison de reclassement standard et utilisez `top_n` pour limiter les résultats retournés, ou définissez `return_embeddings` pour récupérer également les plongements lexicaux des documents. Ce modèle est particulièrement performant pour le classement de données structurées, la recherche juridique et autres recherches spécifiques à un domaine, ainsi que pour les collections multilingues. Son architecture hybride à attention garantit une faible latence, même avec de longues listes de candidats. Disponible sous licence CC-BY-NC-4.0 sur Hugging Face ; contactez-nous pour toute utilisation commerciale.
Blogs qui mentionnent ce modèle



