Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Lecteur
Lisez les URL et effectuez des recherches sur le Web pour de meilleurs LLM de base.
Intégrations
Intégrations multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
Elastic Inference Service
Exécutez les modèles Jina nativement au sein d'Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Architecture
Résultats expérimentaux
Démarrage
Conclusion
star
Mis en exergue
communiqué de presse
août 03, 2026

jina-reranker-v3.5 : Reclassement par liste plus rapide avec attention hybride et autodistillation

Un reranker listwise de 0,6 milliard de paramètres qui surpasse le Qwen3-Reranker-4B sur le benchmark BEIR, offre une vitesse de reranking jusqu'à 1,56 fois plus rapide que la v3, et gagne 9,6 points de nDCG@10 sur la recherche semi-structurée.
Jina AI
Jina AI • 11 minutes lues
jinaai/jina-reranker-v3.5 · Hugging Face
Nous sommes en mission pour faire progresser et démocratiser l'intelligence artificielle grâce à l'open source et à la science ouverte.
jina-reranker-v3.5 : Un重排器 (Reranker) liste efficace avec attention hybride et autodistillation
Les重排器 (Reranker) de type « listwise » constituent le cœur discriminant des pipelines de récupération agentiques, mais le déploiement en production exige simultanément efficacité, robustesse au domaine et fluidité sur les données semi-structurées. Nous présentons jina-reranker-v3.5, un重排器 (Reranker) « listwise » de 0,6 milliard de paramètres qui répond à ces exigences sans sacrifier la comparaison inter-documents qui rendait son prédécesseur, jina-reranker-v3, efficace. Le jina-reranker-v3.5 conserve l'interaction « last-but-not-late » (LBNL) du jina-reranker-v3 et la retravaille selon trois axes. Il remplace l'attention globale uniforme par un calendrier hybride de trois couches à fenêtre glissante suivies de deux couches globales, en fixant la couche terminale en mode global comme l'exige la lecture LBNL. Il est entraîné sur un mélange multi-domaines organisé couvrant le juridique, le médical, la finance, le multilingue et la récupération structurée. Il transfère la qualité via une recette d'autodistillation en trois étapes, où un enseignant à attention complète fixe une limite supérieure qu'un élève à attention creuse récupère ensuite selon un protocole d'adaptation étagé. Le jina-reranker-v3.5 atteint 63,20 nDCG@10 sur BEIR, égalant un modèle de 4 milliards de paramètres avec environ 7 fois moins de paramètres, et surpasse le jina-reranker-v3 sur MIRACL et RTEB. Ses gains les plus importants concernent la récupération semi-structurée, où il augmente le nDCG@10 de 9,6 points par rapport au jina-reranker-v3 et devance tous les重排器 (Reranker) de taille comparable. Le calendrier hybride réduit en outre la latence d'inférence « listwise » jusqu'à 1,56 fois. Nous publions les poids du modèle sur Hugging Face sous une licence non commerciale.
arXiv.orgChristina Nasika

Aujourd'hui, nous publions jina-reranker-v3.5, un重排器 (Reranker) « listwise » de 0,6 milliard de paramètres qui conserve l'interaction last but not late de jina-reranker-v3 tout en le rendant plus rapide et bien plus performant sur les données que les entreprises recherchent réellement. Il atteint 63,20 nDCG@10 sur BEIR, surpassant Qwen3-Reranker-4B avec environ 7 fois moins de paramètres, et effectue le réordonnancement jusqu'à 1,56 fois plus rapidement que la v3 sur de longs documents. Son bond le plus spectaculaire se situe au niveau de la récupération semi-structurée : +9,6 nDCG@10 par rapport à la v3 sur les enregistrements à champs contraints.

Trois changements nous ont permis d'y arriver. Un calendrier d'attention hybride qui remplace la plupart des couches globales par des fenêtres glissantes tout en fixant la couche terminale en mode global. Un mélange d'entraînement sélectionné à partir des modes d'échec de la récupération juridique, médicale, financière, multilingue et structurée. Et une recette d'autodistillation en trois étapes où l'enseignant et l'élève ont la même taille et ne diffèrent que par le schéma d'attention.

Qualité par rapport au nombre de paramètres sur les quatre régimes de référence. jina-reranker-v3.5 se trouve sur la frontière de Pareto dans les quatre cas : aucun modèle que nous avons évalué n'est à la fois plus petit et meilleur.

Scatter plot of nDCG@10 against parameter count on BEIR with a Pareto frontier line
Récupération zero-shot en anglais sur BEIR à travers 13 jeux de données, mesurée par nDCG@10 après le réordonnancement des 100 meilleurs candidats de jina-embeddings-v5-text-small. La ligne rouge trace la frontière de Pareto et la zone ombragée est dominée : pour chaque modèle à l'intérieur, un autre modèle est plus petit, meilleur, ou les deux. jina-reranker-v3.5 définit directement la frontière à 63,20, au-dessus de mxbai-rerank-large-v2 (1,5B) à 62,45 et de Qwen3-Reranker-4B (4B) à 62,28. Aucun modèle plus grand que nous avons évalué n'offre une meilleure qualité sur BEIR.
Scatter plot of nDCG@10 against parameter count on MIRACL with a Pareto frontier line
Récupération multilingue sur MIRACL à travers 18 langues, avec le même protocole de réordonnancement des 100 meilleurs. jina-reranker-v3.5 occupe le coin 0,6B de la frontière à 74,11, le meilleur score parmi tous les modèles compacts, tandis que Qwen3-Reranker-4B occupe le coin 4B à 76,56. Les plus grands gains par langue par rapport à jina-reranker-v3 sont observés sur le yoruba (+4,4), le farsi (+3,1) et le français (+3,0).
Scatter plot of nDCG@10 against parameter count on RTEB with a Pareto frontier line
Récupération dans le domaine professionnel sur RTEB, couvrant les corpus juridiques, financiers, de programmation et médicaux. jina-reranker-v3.5 atteint 70,95, dépassant à la fois Qwen3-Reranker-0.6B (même taille) à 68,41 et mxbai-rerank-large-v2 (1,5B) à 70,81 tout en fonctionnant à 0,6B. L'écart restant avec Qwen3-Reranker-4B à 77,68 se concentre sur quelques tâches juridiques et médicales.
Scatter plot of nDCG@10 against parameter count on Struct-IR with a Pareto frontier line
Récupération semi-structurée sur Struct-IR sous un bassin de candidats contrôlé, où tous les documents « gold » sont injectés aux côtés des 30 distracteurs les plus difficiles de la première étape, afin que la mesure isole la discrimination par contrainte de champ de la couverture de récupération. jina-reranker-v3.5 atteint 48,3, une progression de 9,6 points par rapport à jina-reranker-v3 et la plus grande amélioration unique dans cette version. Notez que ce protocole n'est pas comparable au classement de récupération SSRB.

tagArchitecture

Le réordonnancement « listwise » score chaque candidat en un seul passage (forward pass), de sorte que l'auto-attention complète sur une liste de 100 documents croît de manière quadratique et gonfle le cache KV. La solution évidente est l'attention par fenêtre glissante. Avec l'interaction LBNL, cette solution évidente brise le modèle.

Dans le LBNL, la requête et tous les candidats forment une séquence causale, et le 词元 (token) de 向量模型 (embedding) de la requête se situe à la toute fin. Il doit prêter attention à tout ce qui précède, jusqu'au premier candidat, pour construire une représentation consciente inter-documents. Une fenêtre finie rompt cette dépendance. Nous fixons donc la dernière couche en mode global à tout moment, afin que les 词元 (token) de 向量模型 (embedding) de la requête et des documents observent l'intégralité du contexte des candidats au moment de l'extraction. Remplacer cette seule couche par une fenêtre glissante dégrade gravement le classement « listwise » ; la conserver en mode global préserve l'encodage conjoint sans nécessiter une pile entièrement globale.

Pour les 27 couches restantes, nous avons testé les calendriers 1L1G, 1L2G, 3L2G et 5L1G. Le 3L2G a été retenu : trois couches à fenêtre glissante suivies de deux couches globales, répétées, donnant 17 couches locales et 11 couches globales avec une fenêtre de 1 024 词元 (tokens). Les couches locales réduisent le coût d'attention de O(L²) à O(L·w), tandis que les couches globales tous les trois pas rafraîchissent le signal inter-candidats à longue portée à chaque profondeur. Des calendriers plus denses n'ont apporté aucun gain de débit ; la tendance 5L1G, plus agressive, s'est révélée moins performante sur les tâches complexes impliquant plusieurs documents.

Schéma de l'architecture montrant l'encodage listwise LBNL avec un backbone hybride 3L2G et le pipeline d'auto-distillation en trois étapes
À gauche : encodage listwise LBNL sur un backbone hybride 3L2G Qwen3-0.6B. La requête et tous les candidats partagent un contexte causal ; les couches L utilisent une fenêtre glissante de 1 024 tokens, les couches G sont globales, et la couche terminale G* est fixée globalement afin que l'embedding de la requête finale puisse voir l'ensemble de la liste. Un MLP projette le tout dans un espace partagé et la similarité cosinus produit le classement. À droite : la recette en trois étapes, où l'enseignant en attention complète de l'étape I reste gelé et guide l'étape III.

tagAuto-distillation via un fossé d'attention

La distillation ici est inhabituelle. Nous ne réduisons pas un grand modèle en un plus petit. L'enseignant et l'élève font tous deux 0,6B et ne diffèrent que par leur schéma d'attention. L'enseignant utilise une attention complète à coût quadratique ; l'élève utilise 3L2G.

Forcer un élève à changer de masques d'attention et à correspondre aux sorties de l'enseignant en même temps le fait échouer sur les deux plans, donc la recette découple les deux pressions :

  • Étape I — Enseignant avec attention complète. En partant du point de contrôle public jina-reranker-v3, nous affinons entièrement un enseignant sans restriction de fenêtre glissante sur l'ensemble du mélange v3.5. Cela établit le plafond de qualité pour ce budget de paramètres.
  • Étape II — Adaptation à l'attention creuse. L'élève s'initialise à partir des poids de l'étape I et active le 3L2G. Nous entraînons d'abord uniquement les projections d'attention avec tout le reste gelé, enseignant aux masques creux à acheminer les informations sans perturber les représentations apprises sous attention complète. Ensuite, nous dégelons tout afin que l'élève se réaligne sur la nouvelle géométrie d'attention. L'élève est déjà déployable et plus rapide ici, mais un écart constant par rapport à l'enseignant subsiste sur BEIR, RTEB-legal et MIRACL.
  • Étape III — Distillation guidée par l'enseignant. Avec l'enseignant gelé, nous alignons l'élève sur quatre niveaux simultanément : une KL listwise sur les distributions de scores normalisées par softmax, une MSE sur les scores absolus, une MSE sur les états cachés de la dernière couche, et une perte cosinus sur les embeddings projetés, en plus de régulariseurs de similarité et de dispersion en contexte.

L'ordre compte. L'étape II seule laisse un écart notable car l'élève doit modifier son routage sous un masque plus faible avant de pouvoir imiter en toute sécurité les scores et les états de l'enseignant. L'étape III comble ensuite la majeure partie de cet écart, ce qui indique que la capacité d'attention complète se transfère bien vers un élève creux une fois que la géométrie a été adaptée. La recette est écrite pour le 3L2G mais le schéma se généralise à d'autres inadéquations de planification d'attention.

tagDonnées d'entraînement

Le mélange v3 couvrait bien la recherche générale mais mal les domaines spécialisés. Plutôt que d'ajouter plus de données, nous avons effectué une analyse des erreurs sur les ensembles de développement RTEB et STARK et construit chaque nouveau fragment pour couvrir exactement les modèles de recherche sur lesquels les modèles généraux échouent. Les exemples négatifs difficiles proviennent de plusieurs moteurs de recherche à la fois (BM25, Jina, BGE, GTE, E5, ColBERT) afin que le modèle ne puisse pas apprendre les raccourcis d'un seul moteur.

Le fragment juridique combine EUR-Lex multilingue, CLERC, AILA, la jurisprudence canadienne, le résumé de cas suisses et EuroVoc, suréchantillonnés car le texte juridique est dense en citations et long. Le fragment médical cible le vocabulaire clinique et les passages riches en entités. Le fragment financier privilégie les revendications numériques, le langage réglementaire et les passages incluant des tableaux. La couverture multilingue s'étend au-delà de MIRACL et mMARCO avec WebFAQ dans plus de 50 langues, les exemples négatifs interlingues SWIM-IR et les paires japonaises Ruri-v3.

Les données structurées ont reçu le poids d'échantillonnage le plus élevé, car elles se situent en dehors de la distribution de texte libre supposée par les benchmarks standard. La pertinence par rapport aux enregistrements et aux tableaux repose sur l'égalité, les bornes numériques et de date, l'appartenance à une liste et les combinaisons logiques entre les champs, et non sur le chevauchement lexical. Les premiers tests étaient particulièrement à la traîne ici, nous avons donc synthétisé directement des paires fortement contraintes.

Schéma du pipeline pour générer des données d'entraînement synthétiques hautement contraintes pour la recherche structurée
Supervision synthétique pour la recherche sous contrainte de champ. Nous échantillonnons des contraintes typées à partir d'un enregistrement d'ancrage et demandons à un LLM de les reformuler en une requête, puis nous perturbons un ou deux champs contraints pour construire un exemple négatif difficile quasi identique qui conserve la même forme de surface mais viole une contrainte. L'extraction dense ajoute d'autres candidats et un juge LLM promeut les correspondances réelles, affine les requêtes trop larges et rejette les cas ambigus, en réinjectant les résultats dans la génération de requêtes. L'exemple à droite montre pourquoi le chevauchement lexical est inutile ici : le positif et le négatif difficile sont des chaînes identiques à l'exception d'un seul champ.

tagRésultats expérimentaux

Tous les chiffres correspondent à un reranking des 100 meilleurs candidats issus de jina-embeddings-v5-text-small sous un pipeline MTEB v2 unifié, ils peuvent donc différer légèrement des chiffres rapportés par les fournisseurs. Les tableaux complets par ensemble de données et par langue se trouvent dans l'article.

ModèleParamètresBEIRMIRACLRTEBStruct-IR
jina-embeddings-v5-text-small (1ère étape)0,5B56,2665,1564,60–
mxbai-rerank-base-v20,5B59,5864,9061,4430,4
Qwen3-Reranker-0.6B0,6B56,9467,1268,4141,9
mxbai-rerank-large-v21,5B62,4569,6570,8143,0
Qwen3-Reranker-4B4,0B62,2876,5677,6855,6
jina-reranker-v30,6B62,1072,2068,0138,7
<strong>jina-reranker-v3.5</strong>0,6B63,2074,1170,9548,3

La v3.5 améliore la v3 sur chaque famille de benchmarks au même nombre de paramètres, avec le gain le plus important sur la recherche semi-structurée.

Les gains RTEB se concentrent là où le mélange était ciblé : AILA-Statute s'améliore de 14,0 points et AILA-Case de 11,7 par rapport à la v3, et FinQA atteint 86,91, le meilleur score de tous les modèles testés. Sur STARK, la v3.5 améliore la v3 sur les trois métriques officielles et obtient le meilleur Hit@5 global.

Une note de protocole sur Struct-IR. Le benchmark indexe des millions d'objets par schéma et le Recall@5 de première étape dans le schéma est d'environ 0,04, donc la recherche de bout en bout (retrieve-then-rerank) est presque entièrement limitée par le rappel et différencie mal les重排器 (Rerankers). Nous injectons plutôt tous les documents cibles avec les 30 distracteurs les plus difficiles de la première étape, ce qui isole la discrimination sous contrainte de champ de la couverture de recherche. Les chiffres sous ce pool ne sont pas comparables au classement de recherche SSRB.

tagEfficacité

Mesuré sur un seul NVIDIA A100, taille de lot 1, entrées listwise de 100, FlashAttention-2.

Graphique à barres comparant la latence moyenne de reranking listwise de la v3 et v3.5 sur BEIR Natural Questions
Régime à contexte court, BEIR Natural Questions, avec des longueurs moyennes de requête et de document de 10,3 et 145,5 tokens sur 254 requêtes chronométrées. La latence moyenne pour le reranking listwise des 100 premiers passe de 371 ms à 305 ms, une accélération de 1,22×, et le débit de documents passe de 270 à 328 docs/s.
Graphique à barres comparant la latence moyenne de reranking listwise de la v3 et v3.5 sur RTEB AILACasedocs
Régime à contexte long, RTEB AILACasedocs, avec des longueurs moyennes de requête et de document de 689,8 et 1 904,0 tokens sur 48 requêtes chronométrées. La latence moyenne passe de 16,1 s à 10,3 s, une accélération de 1,56×, et le débit de pré-remplissage passe de 11,9k à 18,6k tokens/s. L'attention hybride est la plus rentable lorsque les passages candidats sont longs.

Étant donné que le reranking listwise en production est dominé par un seul pré-remplissage sur un ensemble de candidats frais, ces réductions se traduisent directement par des listes de candidats plus longues et des documents plus volumineux à budget de service fixe.

tagDémarrage

tagVia l'API Jina Search Foundation

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
  "model": "jina-reranker-v3.5",
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "documents": [
    "...",
    "..."
  ],
  "return_documents": false
}'

tagVia Elastic Inference Service

jina-reranker-v3.5 est disponible sur Elastic Inference Service (EIS) à partir de la Stack 9.3, vous pouvez donc effectuer un reranking sur des GPU gérés sans héberger le modèle vous-même. Créez un point de terminaison d'inférence qui référence le modèle, puis appelez-le comme n'importe quelle autre tâche de rerank.

PUT _inference/rerank/eis-jina-reranker-v3-5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-reranker-v3.5"
  }
}
POST _inference/rerank/eis-jina-reranker-v3-5
{
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "input": [
    "...",
    "..."
  ]
}

La réponse renvoie un tableau rerank ordonné par pertinence, chaque entrée portant l'index original du candidat et son score. Comme il s'agit d'un point de terminaison d'inférence standard, l'inference_id peut être référencé directement depuis un retriever text_similarity_reranker dans une requête de recherche.

tagVia transformers

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3.5',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains catechins that may help reduce inflammation.",
    "El precio del cafe ha aumentado un 20% este ano.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
    "Le the vert est riche en antioxydants.",
]

for r in model.rerank(query, documents):
    print(f"{r['relevance_score']:.4f}  {r['document'][:70]}")

tagConclusion

L'argument pratique en faveur de jina-reranker-v3.5 est précis et vérifiable : avec 0,6 milliard de paramètres, un entraînement ciblé permet de combler la majeure partie de l'écart avec un re-ranker généraliste de 4 milliards de paramètres, et de l'effacer totalement sur BEIR, tout en étant plus rapide que le modèle qu'il remplace. Pour la recherche documentaire en entreprise, cela justifie d'investir dans une supervision focalisée sur une architecture compacte plutôt que de choisir par défaut le plus grand modèle disponible.

Deux limites méritent d'être clairement énoncées. Les re-rankers de type « listwise » comportent toujours des contraintes d'entrée que les modèles « pointwise » et à interaction tardive évitent, en particulier des limites supérieures fixes concernant le nombre de candidats et la longueur totale des candidats. De plus, des écarts importants par rapport au modèle Qwen de 4 milliards de paramètres subsistent sur les tâches juridiques et médicales du RTEB, sur le Struct-IR en environnement contrôlé, ainsi que sur les langues à faibles ressources du MIRACL. Ce sont là les cas les plus complexes, et nous préférons les nommer plutôt que de les masquer derrière une moyenne.

Catégories:
star
Mis en exergue
communiqué de presse
rss_feed

En savoir plus
mai 12, 2026 • 7 minutes lues
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
février 19, 2026 • 7 minutes lues
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
décembre 04, 2025 • 7 minutes lues
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Langue / thème actuel
Search Foundation
Lecteur
Intégrations
Reclasseur
Obtenir la clé API Jina
Limite de taux
À propos de nous
Nouvelles
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.Sécuritétermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, logiciels, produits et services sont destinés exclusivement à un usage professionnel. Leur utilisation par les consommateurs n'est ni prévue ni autorisée.