

Aujourd'hui, nous publions jina-reranker-v3.5, un重排器 (Reranker) « listwise » de 0,6 milliard de paramètres qui conserve l'interaction last but not late de jina-reranker-v3 tout en le rendant plus rapide et bien plus performant sur les données que les entreprises recherchent réellement. Il atteint 63,20 nDCG@10 sur BEIR, surpassant Qwen3-Reranker-4B avec environ 7 fois moins de paramètres, et effectue le réordonnancement jusqu'à 1,56 fois plus rapidement que la v3 sur de longs documents. Son bond le plus spectaculaire se situe au niveau de la récupération semi-structurée : +9,6 nDCG@10 par rapport à la v3 sur les enregistrements à champs contraints.
Trois changements nous ont permis d'y arriver. Un calendrier d'attention hybride qui remplace la plupart des couches globales par des fenêtres glissantes tout en fixant la couche terminale en mode global. Un mélange d'entraînement sélectionné à partir des modes d'échec de la récupération juridique, médicale, financière, multilingue et structurée. Et une recette d'autodistillation en trois étapes où l'enseignant et l'élève ont la même taille et ne diffèrent que par le schéma d'attention.
Qualité par rapport au nombre de paramètres sur les quatre régimes de référence. jina-reranker-v3.5 se trouve sur la frontière de Pareto dans les quatre cas : aucun modèle que nous avons évalué n'est à la fois plus petit et meilleur.

mxbai-rerank-large-v2 (1,5B) à 62,45 et de Qwen3-Reranker-4B (4B) à 62,28. Aucun modèle plus grand que nous avons évalué n'offre une meilleure qualité sur BEIR.
Qwen3-Reranker-4B occupe le coin 4B à 76,56. Les plus grands gains par langue par rapport à jina-reranker-v3 sont observés sur le yoruba (+4,4), le farsi (+3,1) et le français (+3,0).
Qwen3-Reranker-0.6B (même taille) à 68,41 et mxbai-rerank-large-v2 (1,5B) à 70,81 tout en fonctionnant à 0,6B. L'écart restant avec Qwen3-Reranker-4B à 77,68 se concentre sur quelques tâches juridiques et médicales.
tagArchitecture
Le réordonnancement « listwise » score chaque candidat en un seul passage (forward pass), de sorte que l'auto-attention complète sur une liste de 100 documents croît de manière quadratique et gonfle le cache KV. La solution évidente est l'attention par fenêtre glissante. Avec l'interaction LBNL, cette solution évidente brise le modèle.
Dans le LBNL, la requête et tous les candidats forment une séquence causale, et le 词元 (token) de 向量模型 (embedding) de la requête se situe à la toute fin. Il doit prêter attention à tout ce qui précède, jusqu'au premier candidat, pour construire une représentation consciente inter-documents. Une fenêtre finie rompt cette dépendance. Nous fixons donc la dernière couche en mode global à tout moment, afin que les 词元 (token) de 向量模型 (embedding) de la requête et des documents observent l'intégralité du contexte des candidats au moment de l'extraction. Remplacer cette seule couche par une fenêtre glissante dégrade gravement le classement « listwise » ; la conserver en mode global préserve l'encodage conjoint sans nécessiter une pile entièrement globale.
Pour les 27 couches restantes, nous avons testé les calendriers 1L1G, 1L2G, 3L2G et 5L1G. Le 3L2G a été retenu : trois couches à fenêtre glissante suivies de deux couches globales, répétées, donnant 17 couches locales et 11 couches globales avec une fenêtre de 1 024 词元 (tokens). Les couches locales réduisent le coût d'attention de O(L²) à O(L·w), tandis que les couches globales tous les trois pas rafraîchissent le signal inter-candidats à longue portée à chaque profondeur. Des calendriers plus denses n'ont apporté aucun gain de débit ; la tendance 5L1G, plus agressive, s'est révélée moins performante sur les tâches complexes impliquant plusieurs documents.

tagAuto-distillation via un fossé d'attention
La distillation ici est inhabituelle. Nous ne réduisons pas un grand modèle en un plus petit. L'enseignant et l'élève font tous deux 0,6B et ne diffèrent que par leur schéma d'attention. L'enseignant utilise une attention complète à coût quadratique ; l'élève utilise 3L2G.
Forcer un élève à changer de masques d'attention et à correspondre aux sorties de l'enseignant en même temps le fait échouer sur les deux plans, donc la recette découple les deux pressions :
- Étape I — Enseignant avec attention complète. En partant du point de contrôle public jina-reranker-v3, nous affinons entièrement un enseignant sans restriction de fenêtre glissante sur l'ensemble du mélange v3.5. Cela établit le plafond de qualité pour ce budget de paramètres.
- Étape II — Adaptation à l'attention creuse. L'élève s'initialise à partir des poids de l'étape I et active le 3L2G. Nous entraînons d'abord uniquement les projections d'attention avec tout le reste gelé, enseignant aux masques creux à acheminer les informations sans perturber les représentations apprises sous attention complète. Ensuite, nous dégelons tout afin que l'élève se réaligne sur la nouvelle géométrie d'attention. L'élève est déjà déployable et plus rapide ici, mais un écart constant par rapport à l'enseignant subsiste sur BEIR, RTEB-legal et MIRACL.
- Étape III — Distillation guidée par l'enseignant. Avec l'enseignant gelé, nous alignons l'élève sur quatre niveaux simultanément : une KL listwise sur les distributions de scores normalisées par softmax, une MSE sur les scores absolus, une MSE sur les états cachés de la dernière couche, et une perte cosinus sur les embeddings projetés, en plus de régulariseurs de similarité et de dispersion en contexte.
L'ordre compte. L'étape II seule laisse un écart notable car l'élève doit modifier son routage sous un masque plus faible avant de pouvoir imiter en toute sécurité les scores et les états de l'enseignant. L'étape III comble ensuite la majeure partie de cet écart, ce qui indique que la capacité d'attention complète se transfère bien vers un élève creux une fois que la géométrie a été adaptée. La recette est écrite pour le 3L2G mais le schéma se généralise à d'autres inadéquations de planification d'attention.
tagDonnées d'entraînement
Le mélange v3 couvrait bien la recherche générale mais mal les domaines spécialisés. Plutôt que d'ajouter plus de données, nous avons effectué une analyse des erreurs sur les ensembles de développement RTEB et STARK et construit chaque nouveau fragment pour couvrir exactement les modèles de recherche sur lesquels les modèles généraux échouent. Les exemples négatifs difficiles proviennent de plusieurs moteurs de recherche à la fois (BM25, Jina, BGE, GTE, E5, ColBERT) afin que le modèle ne puisse pas apprendre les raccourcis d'un seul moteur.
Le fragment juridique combine EUR-Lex multilingue, CLERC, AILA, la jurisprudence canadienne, le résumé de cas suisses et EuroVoc, suréchantillonnés car le texte juridique est dense en citations et long. Le fragment médical cible le vocabulaire clinique et les passages riches en entités. Le fragment financier privilégie les revendications numériques, le langage réglementaire et les passages incluant des tableaux. La couverture multilingue s'étend au-delà de MIRACL et mMARCO avec WebFAQ dans plus de 50 langues, les exemples négatifs interlingues SWIM-IR et les paires japonaises Ruri-v3.
Les données structurées ont reçu le poids d'échantillonnage le plus élevé, car elles se situent en dehors de la distribution de texte libre supposée par les benchmarks standard. La pertinence par rapport aux enregistrements et aux tableaux repose sur l'égalité, les bornes numériques et de date, l'appartenance à une liste et les combinaisons logiques entre les champs, et non sur le chevauchement lexical. Les premiers tests étaient particulièrement à la traîne ici, nous avons donc synthétisé directement des paires fortement contraintes.

tagRésultats expérimentaux
Tous les chiffres correspondent à un reranking des 100 meilleurs candidats issus de jina-embeddings-v5-text-small sous un pipeline MTEB v2 unifié, ils peuvent donc différer légèrement des chiffres rapportés par les fournisseurs. Les tableaux complets par ensemble de données et par langue se trouvent dans l'article.
| Modèle | Paramètres | BEIR | MIRACL | RTEB | Struct-IR |
|---|---|---|---|---|---|
| jina-embeddings-v5-text-small (1ère étape) | 0,5B | 56,26 | 65,15 | 64,60 | – |
| mxbai-rerank-base-v2 | 0,5B | 59,58 | 64,90 | 61,44 | 30,4 |
| Qwen3-Reranker-0.6B | 0,6B | 56,94 | 67,12 | 68,41 | 41,9 |
| mxbai-rerank-large-v2 | 1,5B | 62,45 | 69,65 | 70,81 | 43,0 |
| Qwen3-Reranker-4B | 4,0B | 62,28 | 76,56 | 77,68 | 55,6 |
| jina-reranker-v3 | 0,6B | 62,10 | 72,20 | 68,01 | 38,7 |
| <strong>jina-reranker-v3.5</strong> | 0,6B | 63,20 | 74,11 | 70,95 | 48,3 |
La v3.5 améliore la v3 sur chaque famille de benchmarks au même nombre de paramètres, avec le gain le plus important sur la recherche semi-structurée.
Les gains RTEB se concentrent là où le mélange était ciblé : AILA-Statute s'améliore de 14,0 points et AILA-Case de 11,7 par rapport à la v3, et FinQA atteint 86,91, le meilleur score de tous les modèles testés. Sur STARK, la v3.5 améliore la v3 sur les trois métriques officielles et obtient le meilleur Hit@5 global.
Une note de protocole sur Struct-IR. Le benchmark indexe des millions d'objets par schéma et le Recall@5 de première étape dans le schéma est d'environ 0,04, donc la recherche de bout en bout (retrieve-then-rerank) est presque entièrement limitée par le rappel et différencie mal les重排器 (Rerankers). Nous injectons plutôt tous les documents cibles avec les 30 distracteurs les plus difficiles de la première étape, ce qui isole la discrimination sous contrainte de champ de la couverture de recherche. Les chiffres sous ce pool ne sont pas comparables au classement de recherche SSRB.
tagEfficacité
Mesuré sur un seul NVIDIA A100, taille de lot 1, entrées listwise de 100, FlashAttention-2.


Étant donné que le reranking listwise en production est dominé par un seul pré-remplissage sur un ensemble de candidats frais, ces réductions se traduisent directement par des listes de candidats plus longues et des documents plus volumineux à budget de service fixe.
tagDémarrage
tagVia l'API Jina Search Foundation
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-reranker-v3.5",
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"documents": [
"...",
"..."
],
"return_documents": false
}'tagVia Elastic Inference Service
jina-reranker-v3.5 est disponible sur Elastic Inference Service (EIS) à partir de la Stack 9.3, vous pouvez donc effectuer un reranking sur des GPU gérés sans héberger le modèle vous-même. Créez un point de terminaison d'inférence qui référence le modèle, puis appelez-le comme n'importe quelle autre tâche de rerank.
PUT _inference/rerank/eis-jina-reranker-v3-5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-reranker-v3.5"
}
}POST _inference/rerank/eis-jina-reranker-v3-5
{
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"input": [
"...",
"..."
]
}La réponse renvoie un tableau rerank ordonné par pertinence, chaque entrée portant l'index original du candidat et son score. Comme il s'agit d'un point de terminaison d'inférence standard, l'inference_id peut être référencé directement depuis un retriever text_similarity_reranker dans une requête de recherche.
tagVia transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3.5',
dtype="auto",
trust_remote_code=True,
)
model.eval()
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains catechins that may help reduce inflammation.",
"El precio del cafe ha aumentado un 20% este ano.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
"Le the vert est riche en antioxydants.",
]
for r in model.rerank(query, documents):
print(f"{r['relevance_score']:.4f} {r['document'][:70]}")tagConclusion
L'argument pratique en faveur de jina-reranker-v3.5 est précis et vérifiable : avec 0,6 milliard de paramètres, un entraînement ciblé permet de combler la majeure partie de l'écart avec un re-ranker généraliste de 4 milliards de paramètres, et de l'effacer totalement sur BEIR, tout en étant plus rapide que le modèle qu'il remplace. Pour la recherche documentaire en entreprise, cela justifie d'investir dans une supervision focalisée sur une architecture compacte plutôt que de choisir par défaut le plus grand modèle disponible.
Deux limites méritent d'être clairement énoncées. Les re-rankers de type « listwise » comportent toujours des contraintes d'entrée que les modèles « pointwise » et à interaction tardive évitent, en particulier des limites supérieures fixes concernant le nombre de candidats et la longueur totale des candidats. De plus, des écarts importants par rapport au modèle Qwen de 4 milliards de paramètres subsistent sur les tâches juridiques et médicales du RTEB, sur le Struct-IR en environnement contrôlé, ainsi que sur les langues à faibles ressources du MIRACL. Ce sont là les cas les plus complexes, et nous préférons les nommer plutôt que de les masquer derrière une moyenne.






