Elastic
Jina AI
Modelli
API
keyboard_arrow_down
Lettore
Leggi gli URL e cerca sul web per ottenere LLM più approfonditi.
Incorporamenti
Incorporamenti multimodali multilingue.
Riclassificazione
Strumento di riordinamento per massimizzare la pertinenza dei risultati di ricerca.
Elastic Inference Service
Esegui i modelli Jina in modo nativo all'interno di Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agenti
data_object
Schema
menu_book
Documenti
Login
login
Architettura
Risultati sperimentali
Iniziare
Conclusione
star
In primo piano
comunicato stampa
agosto 03, 2026

jina-reranker-v3.5: Reranking listwise più veloce con Hybrid Attention e Self-Distillation

Un Reranker listwise da 0,6B che supera Qwen3-Reranker-4B su BEIR, esegue il reranking fino a 1,56 volte più velocemente rispetto alla v3 e guadagna 9,6 nDCG@10 nel recupero semi-strutturato.
Jina AI
Jina AI • 11 minuti letti
jinaai/jina-reranker-v3.5 · Hugging Face
Siamo in un viaggio per far progredire e democratizzare l'intelligenza artificiale attraverso l'open source e la scienza aperta.
jina-reranker-v3.5: An Efficient Listwise Reranker with Hybrid Attention and Self-Distillation
I重排器 di tipo listwise rappresentano il nucleo discriminante delle pipeline di recupero basate su agenti, tuttavia l'implementazione in produzione richiede simultaneamente efficienza, robustezza del dominio e fluidità sui dati semi-strutturati. Presentiamo jina-reranker-v3.5, un 重排器 di tipo listwise da 0,6 miliardi di parametri che soddisfa queste esigenze senza sacrificare il confronto cross-document che rende efficace il suo predecessore, jina-reranker-v3. jina-reranker-v3.5 mantiene l'interazione "last-but-not-late" (LBNL) di jina-reranker-v3 e la rielabora lungo tre assi. Sostituisce l'attenzione globale uniforme con una pianificazione ibrida di tre strati a finestra scorrevole seguiti da due strati globali, fissando lo strato terminale su globale come richiesto dalla lettura LBNL. Si addestra su una miscela multi-dominio curata che spazia tra recupero legale, medico, finanziario, multilingue e strutturato. Trasferisce la qualità attraverso una ricetta di auto-distillazione a tre stadi in cui un insegnante a piena attenzione stabilisce un limite superiore che uno studente con attenzione sparsa recupera quindi sotto un protocollo di adattamento a stadi. jina-reranker-v3.5 raggiunge 63,20 nDCG@10 su BEIR, eguagliando un modello da 4 miliardi di parametri con circa 7 volte meno parametri, e migliora rispetto a jina-reranker-v3 anche su MIRACL e RTEB. I guadagni maggiori si ottengono nel recupero semi-strutturato, dove aumenta il nDCG@10 di 9,6 punti rispetto a jina-reranker-v3 e supera tutti i 重排器 di dimensioni comparabili. La pianificazione ibrida riduce ulteriormente la latenza di inferenza listwise fino a 1,56 volte. Rilasciamo i pesi del modello su Hugging Face con una licenza non commerciale.
arXiv.orgChristina Nasika

Oggi rilasciamo jina-reranker-v3.5, un 重排器 di tipo listwise da 0,6 miliardi di parametri che mantiene l'interazione last but not late di jina-reranker-v3 e lo rende più veloce e molto più capace sui dati che le aziende cercano effettivamente. Raggiunge 63,20 nDCG@10 su BEIR, superando Qwen3-Reranker-4B con circa 7 volte meno parametri, e riordina fino a 1,56 volte più velocemente rispetto alla v3 su documenti lunghi. Il salto più grande si registra nel recupero semi-strutturato: +9,6 nDCG@10 rispetto alla v3 su record con vincoli di campo.

Tre cambiamenti ci hanno permesso di arrivare fin qui. Una pianificazione dell'attenzione ibrida che sostituisce la maggior parte degli strati globali con finestre scorrevoli, mantenendo fisso lo strato terminale su globale. Una miscela di addestramento curata partendo dalle modalità di errore dei recuperi legali, medici, finanziari, multilingue e strutturati. E una ricetta di auto-distillazione a tre stadi in cui insegnante e studente hanno le stesse dimensioni e differiscono solo per il pattern di attenzione.

Qualità rispetto al numero di parametri nei quattro regimi di benchmark. jina-reranker-v3.5 si trova sulla frontiera di Pareto in tutti e quattro i casi: nessun modello che abbiamo valutato è contemporaneamente più piccolo e migliore.

Scatter plot of nDCG@10 against parameter count on BEIR with a Pareto frontier line
Recupero zero-shot in inglese su BEIR attraverso 13 dataset, misurato tramite nDCG@10 dopo aver riordinato i primi 100 candidati da jina-embeddings-v5-text-small. La linea rossa traccia la frontiera di Pareto e la regione ombreggiata è dominata: per ogni modello al suo interno, esiste qualche altro modello più piccolo, migliore o entrambi. jina-reranker-v3.5 definisce direttamente la frontiera a 63,20, sopra il modello mxbai-rerank-large-v2 da 1,5 miliardi di parametri a 62,45 e il modello Qwen3-Reranker-4B da 4 miliardi di parametri a 62,28. Nessun modello più grande che abbiamo valutato offre una qualità BEIR superiore.
Scatter plot of nDCG@10 against parameter count on MIRACL with a Pareto frontier line
Recupero multilingue su MIRACL attraverso 18 lingue, stesso protocollo di riordinamento dei primi 100. jina-reranker-v3.5 occupa l'angolo da 0,6 miliardi della frontiera a 74,11, il miglior punteggio di qualsiasi modello compatto, mentre Qwen3-Reranker-4B occupa l'angolo da 4 miliardi a 76,56. I maggiori guadagni per lingua rispetto a jina-reranker-v3 si registrano in yoruba (+4,4), farsi (+3,1) e francese (+3,0).
Scatter plot of nDCG@10 against parameter count on RTEB with a Pareto frontier line
Recupero in domini professionali su RTEB, che copre corpora legali, finanziari, di programmazione e medici. jina-reranker-v3.5 raggiunge 70,95, superando sia il modello di pari dimensioni Qwen3-Reranker-0.6B a 68,41 che il modello mxbai-rerank-large-v2 da 1,5 miliardi di parametri a 70,81, pur funzionando a 0,6 miliardi. La distanza residua da Qwen3-Reranker-4B a 77,68 si concentra in una manciata di attività legali e mediche.
Scatter plot of nDCG@10 against parameter count on Struct-IR with a Pareto frontier line
Recupero semi-strutturato su Struct-IR con un pool di candidati controllato, dove tutti i documenti "gold" vengono inseriti insieme ai 30 distrattori più difficili del primo stadio, in modo che la misurazione isoli la discriminazione vincolata dal campo dalla copertura del recupero. jina-reranker-v3.5 raggiunge 48,3, un incremento di 9,6 punti rispetto a jina-reranker-v3 e il più grande miglioramento singolo in questo rilascio. Si noti che questo protocollo non è confrontabile con la classifica di recupero SSRB.

tagArchitettura

Il riordinamento listwise assegna un punteggio a ogni candidato in un singolo passaggio in avanti (forward pass), quindi l'auto-attenzione completa su una lista di 100 documenti cresce in modo quadratico e gonfia la KV cache. La soluzione ovvia è l'attenzione a finestra scorrevole. Con l'interazione LBNL, la soluzione ovvia rompe il modello.

Nell'LBNL, la query e tutti i candidati formano un'unica sequenza causale e il 词元 (token) di embedding della query si trova alla fine. Deve prestare attenzione fino al primo candidato per costruire una rappresentazione consapevole dei documenti incrociati. Una finestra finita interrompe tale dipendenza. Pertanto, fissiamo costantemente l'ultimo strato su globale, in modo che i 词元 (token) di embedding della query e del documento osservino l'intero contesto dei candidati al momento dell'estrazione. Sostituire quello strato con una finestra scorrevole degrada gravemente il ranking listwise; mantenerlo globale preserva la codifica congiunta senza uno stack completamente globale.

Per i restanti 27 strati abbiamo cercato pianificazioni 1L1G, 1L2G, 3L2G e 5L1G. Ha vinto 3L2G: tre strati a finestra scorrevole seguiti da due strati globali, ripetuti, ottenendo 17 strati locali e 11 globali con una finestra di 1.024 词元 (token). Gli strati locali riducono il costo dell'attenzione da O(L²) a O(L·w), mentre gli strati globali ogni tre passaggi aggiornano il segnale inter-candidato a lungo raggio a ogni profondità. Pianificazioni più dense non hanno prodotto alcun vantaggio in termini di throughput; la pianificazione più aggressiva 5L1G ha mostrato risultati peggiori su attività complesse multi-documento.

Diagramma dell'architettura che mostra la codifica listwise LBNL con un backbone ibrido 3L2G e la pipeline di auto-distillazione a tre stadi
Sinistra: Codifica listwise LBNL su un backbone ibrido Qwen3-0.6B 3L2G. La query e tutti i candidati condividono un unico contesto causale; i layer L utilizzano una finestra scorrevole di 1.024词元, i layer G sono globali e il layer terminale G* è fissato come globale in modo che il vettore della query finale possa vedere l'intera lista. Un MLP proietta in uno spazio condiviso e la similarità del coseno produce il ranking. Destra: la ricetta a tre stadi, in cui il teacher full-attention dello Stadio I rimane bloccato e guida lo Stadio III.

tagAuto-distillazione attraverso un gap di attenzione

La distillazione qui è insolita. Non riduciamo un grande modello in uno piccolo. Teacher e student sono entrambi da 0.6B e differiscono solo per il pattern di attenzione. Il teacher esegue un'attenzione completa a costo quadratico; lo student esegue 3L2G.

Forzare uno student a cambiare le maschere di attenzione e allo stesso tempo corrispondere agli output del teacher lo porta a fallire in entrambi, quindi la ricetta disaccoppia le due pressioni:

  • Stadio I — teacher full-attention. Partendo dal checkpoint pubblico jina-reranker-v3, effettuiamo un fine-tuning completo di un teacher senza restrizioni di finestra scorrevole sull'intero set di dati v3.5. Stabilisce il limite massimo di qualità per questo budget di parametri.
  • Stadio II — adattamento sparse-attention. Lo student si inizializza dai pesi dello Stadio I e attiva il 3L2G. Per prima cosa addestriamo solo le proiezioni dell'attenzione con tutto il resto bloccato, insegnando alle maschere sparse a instradare le informazioni senza disturbare le rappresentazioni apprese sotto l'attenzione completa. Successivamente sblocchiamo tutto in modo che lo student si riallinei alla nuova geometria dell'attenzione. Lo student è già distribuibile e più veloce a questo punto, ma rimane un gap coerente rispetto al teacher su BEIR, RTEB-legal e MIRACL.
  • Stadio III — distillazione guidata dal teacher. Con il teacher bloccato, allineiamo lo student su quattro livelli contemporaneamente: un KL listwise su distribuzioni di punteggio normalizzate tramite softmax, un MSE sui punteggi assoluti, un MSE sugli stati nascosti dell'ultimo layer e una perdita di coseno sui vettori proiettati, oltre a regolarizzatori di similarità e dispersione in-context.

L'ordine è importante. Il solo Stadio II lascia un divario evidente perché lo student deve cambiare il proprio routing sotto una maschera più debole prima di poter imitare in modo sicuro i punteggi e gli stati del teacher. Lo Stadio III recupera quindi gran parte di quel divario, il che dimostra che la capacità della full-attention viene trasferita in uno student sparso una volta che la geometria si è adattata. La ricetta è scritta per 3L2G, ma lo schema si generalizza ad altri disallineamenti della programmazione dell'attenzione.

tagDati di addestramento

Il mix v3 copriva bene il recupero generale e meno bene i domini specializzati. Invece di aggiungere più dati, abbiamo eseguito un'analisi degli errori sui set di sviluppo RTEB e STARK e costruito ogni nuovo shard per coprire esattamente i pattern di recupero su cui falliscono i modelli generici. Gli hard negative provengono da diversi sistemi di recupero contemporaneamente (BM25, Jina, BGE, GTE, E5, ColBERT) in modo che il modello non possa imparare le scorciatoie di un singolo sistema.

Lo shard legale combina EUR-Lex multilingue, CLERC, AILA, giurisprudenza canadese, riassunti di casi svizzeri ed EuroVoc, sovracampionati perché il testo legale è denso di citazioni e lungo. Lo shard medico mira alla terminologia clinica e a passaggi ricchi di entità. Lo shard finanziario dà priorità a rivendicazioni numeriche, linguaggio normativo e passaggi che includono tabelle. La copertura multilingue si estende oltre MIRACL e mMARCO con WebFAQ in oltre 50 lingue, negativi cross-lingue SWIM-IR e coppie giapponesi Ruri-v3.

I dati strutturati hanno ottenuto il peso di campionamento più elevato, perché si trovano al di fuori della distribuzione di testo libero presupposta dai benchmark standard. La rilevanza su record e tabelle dipende da uguaglianza, limiti numerici e di data, appartenenza a liste e combinazioni logiche tra campi, non dalla sovrapposizione lessicale. Le prime esecuzioni sono state le peggiori qui, quindi abbiamo sintetizzato direttamente coppie ad alto vincolo.

Diagramma della pipeline per la generazione di dati di addestramento sintetici ad alto vincolo per il recupero strutturato
Supervisione sintetica per il recupero con vincoli di campo. Campioniamo vincoli tipizzati da un record di ancoraggio e facciamo in modo che un 大模型 li parafrasi in una query, quindi perturbiamo uno o due campi vincolati per costruire un hard negative quasi identico che mantenga la stessa forma superficiale ma violi un vincolo. Il dense mining aggiunge ulteriori candidati e un giudice的大模型 promuove le corrispondenze reali, raffina le query troppo ampie e scarta i casi ambigui, reinserendo i risultati nella generazione delle query. L'esempio a destra mostra perché la sovrapposizione lessicale è inutile qui: il positivo e l'hard negative sono stringhe identiche a parte un singolo campo.

tagRisultati sperimentali

Tutti i numeri classificano nuovamente i primi 100 candidati da jina-embeddings-v5-text-small sotto un'unica pipeline MTEB v2 unificata, quindi potrebbero differire leggermente dalle cifre riportate dal fornitore. Le tabelle complete per set di dati e per lingua sono presenti nel documento.

ModelloParametriBEIRMIRACLRTEBStruct-IR
jina-embeddings-v5-text-small (1° stadio)0.5B56.2665.1564.60–
mxbai-rerank-base-v20.5B59.5864.9061.4430.4
Qwen3-Reranker-0.6B0.6B56.9467.1268.4141.9
mxbai-rerank-large-v21.5B62.4569.6570.8143.0
Qwen3-Reranker-4B4.0B62.2876.5677.6855.6
jina-reranker-v30.6B62.1072.2068.0138.7
<strong>jina-reranker-v3.5</strong>0.6B63.2074.1170.9548.3

La v3.5 migliora rispetto alla v3 in ogni famiglia di benchmark a parità di conteggio di parametri, con il guadagno maggiore nel recupero semi-strutturato.

I guadagni in RTEB si concentrano dove era mirato il mix: AILA-Statute migliora di 14,0 punti e AILA-Case di 11,7 rispetto alla v3, e FinQA raggiunge 86,91, il migliore tra tutti i modelli testati. Su STARK, la v3.5 migliora rispetto alla v3 in tutte e tre le metriche ufficiali e ottiene il miglior Hit@5 complessivo.

Una nota di protocollo su Struct-IR. Il benchmark indicizza milioni di oggetti per schema e il Recall@5 dell'in-schema al primo stadio è di circa 0,04, quindi il recupero end-to-end "retrieve-then-rerank" è quasi interamente limitato dal richiamo e distingue male i 重排器. Abbiamo invece inserito tutti i documenti "gold" insieme ai 30 distrattori più difficili del primo stadio, il che isola la discriminazione con vincoli di campo dalla copertura di recupero. I numeri sotto quel pool non sono confrontabili con la classifica di recupero SSRB.

tagEfficienza

Misurata su una singola NVIDIA A100, batch size 1, input listwise top-100, FlashAttention-2.

Grafico a barre che confronta la latenza media di reranking listwise di v3 e v3.5 su BEIR Natural Questions
Regime a contesto breve, BEIR Natural Questions, con lunghezze medie di query e documento di 10,3 e 145,5 词元 su 254 query cronometrate. La latenza media per il reranking listwise top-100 scende da 371 ms a 305 ms, un'accelerazione di 1,22 volte, e il throughput dei documenti sale da 270 a 328 doc/s.
Grafico a barre che confronta la latenza media di reranking listwise di v3 e v3.5 su RTEB AILACasedocs
Regime a contesto lungo, RTEB AILACasedocs, con lunghezze medie di query e documento di 689,8 e 1.904,0 词元 su 48 query cronometrate. La latenza media scende da 16,1 s a 10,3 s, un'accelerazione di 1,56 volte, e il throughput di prefill sale da 11,9k a 18,6k 词元/s. L'attenzione ibrida ripaga maggiormente quando i passaggi candidati sono lunghi.

Poiché il reranking listwise in produzione è dominato da un singolo prefill su un nuovo set di candidati, queste riduzioni si traducono direttamente in liste di candidati più lunghe e documenti più grandi a parità di budget di servizio.

tagIniziare

tagTramite Jina Search Foundation API

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
  "model": "jina-reranker-v3.5",
  "query": "scarpe da trail running sotto i 150$, valutazione 4.5+, rilasciate dal 2022",
  "documents": [
    "...",
    "..."
  ],
  "return_documents": false
}'

tagTramite Elastic Inference Service

jina-reranker-v3.5 è disponibile su Elastic Inference Service (EIS) dallo Stack 9.3, quindi è possibile eseguire il reranking su GPU gestite senza ospitare il modello autonomamente. Crea un endpoint di inferenza che faccia riferimento al modello, quindi chiamalo come qualsiasi altra attività di rerank.

PUT _inference/rerank/eis-jina-reranker-v3-5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-reranker-v3.5"
  }
}
POST _inference/rerank/eis-jina-reranker-v3-5
{
  "query": "scarpe da trail running sotto i 150$, valutazione 4.5+, rilasciate dal 2022",
  "input": [
    "...",
    "..."
  ]
}

La risposta restituisce un array rerank ordinato per rilevanza, ogni voce riporta l'indice originale del candidato e il suo punteggio. Poiché si tratta di un endpoint di inferenza standard, l'inference_id può essere referenziato direttamente da un retriever text_similarity_reranker in una query di ricerca.

tagTramite transformers

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3.5',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains catechins that may help reduce inflammation.",
    "El precio del cafe ha aumentado un 20% este ano.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
    "Le the vert est riche en antioxydants.",
]

for r in model.rerank(query, documents):
    print(f"{r['relevance_score']:.4f}  {r['document'][:70]}")

tagConclusione

La pretesa pratica di jina-reranker-v3.5 è circoscritta e verificabile: con 0,6 miliardi di parametri, un addestramento mirato colma gran parte del divario rispetto a un Reranker generalista da 4 miliardi di parametri, arrivando ad azzerarlo completamente sul benchmark BEIR, il tutto con una velocità di esecuzione superiore al modello che sostituisce. Per il recupero informazioni in ambito aziendale, ciò depone a favore dell'investimento in una supervisione focalizzata su una dorsale compatta, piuttosto che sull'utilizzo predefinito del modello più grande disponibile.

Due limitazioni meritano di essere esposte chiaramente. I Reranker di tipo listwise presentano ancora vincoli di input che i modelli pointwise e a interazione tardiva evitano, in particolare limiti superiori fissi sul numero di candidati e sulla lunghezza totale dei candidati. Inoltre, permangono lacune significative rispetto al modello Qwen da 4 miliardi di parametri nei compiti legali e medici del benchmark RTEB, nello Struct-IR con pool controllato e nelle lingue a basse risorse del benchmark MIRACL. Si tratta di casi complessi, che preferiamo nominare esplicitamente piuttosto che nascondere dietro una media statistica.

Categorie:
star
In primo piano
comunicato stampa
rss_feed

Per saperne di più
maggio 12, 2026 • 7 minuti letti
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
febbraio 19, 2026 • 7 minuti letti
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
dicembre 04, 2025 • 7 minuti letti
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Lingua / tema attuale
Search Foundation
Lettore
Incorporamenti
Riclassificazione
Ottieni la chiave API Jina
Limite di velocità
Chi siamo
Notizia
Scarica il logo Jina
open_in_new
Scarica il logo Elastic
open_in_new
Stato dell'API
Elastic © 2026.SicurezzaTermini & CondizioniPrivacyGestisci i cookieNon vendere né condividere le mie informazioni personali
Questo sito web e tutti i contenuti, software, prodotti e servizi ad esso associati sono destinati esclusivamente all'uso professionale. Non è previsto né raccomandato alcun utilizzo da parte dei consumatori.