

Oggi rilasciamo jina-reranker-v3.5, un 重排器 di tipo listwise da 0,6 miliardi di parametri che mantiene l'interazione last but not late di jina-reranker-v3 e lo rende più veloce e molto più capace sui dati che le aziende cercano effettivamente. Raggiunge 63,20 nDCG@10 su BEIR, superando Qwen3-Reranker-4B con circa 7 volte meno parametri, e riordina fino a 1,56 volte più velocemente rispetto alla v3 su documenti lunghi. Il salto più grande si registra nel recupero semi-strutturato: +9,6 nDCG@10 rispetto alla v3 su record con vincoli di campo.
Tre cambiamenti ci hanno permesso di arrivare fin qui. Una pianificazione dell'attenzione ibrida che sostituisce la maggior parte degli strati globali con finestre scorrevoli, mantenendo fisso lo strato terminale su globale. Una miscela di addestramento curata partendo dalle modalità di errore dei recuperi legali, medici, finanziari, multilingue e strutturati. E una ricetta di auto-distillazione a tre stadi in cui insegnante e studente hanno le stesse dimensioni e differiscono solo per il pattern di attenzione.
Qualità rispetto al numero di parametri nei quattro regimi di benchmark. jina-reranker-v3.5 si trova sulla frontiera di Pareto in tutti e quattro i casi: nessun modello che abbiamo valutato è contemporaneamente più piccolo e migliore.

mxbai-rerank-large-v2 da 1,5 miliardi di parametri a 62,45 e il modello Qwen3-Reranker-4B da 4 miliardi di parametri a 62,28. Nessun modello più grande che abbiamo valutato offre una qualità BEIR superiore.
Qwen3-Reranker-4B occupa l'angolo da 4 miliardi a 76,56. I maggiori guadagni per lingua rispetto a jina-reranker-v3 si registrano in yoruba (+4,4), farsi (+3,1) e francese (+3,0).
Qwen3-Reranker-0.6B a 68,41 che il modello mxbai-rerank-large-v2 da 1,5 miliardi di parametri a 70,81, pur funzionando a 0,6 miliardi. La distanza residua da Qwen3-Reranker-4B a 77,68 si concentra in una manciata di attività legali e mediche.
tagArchitettura
Il riordinamento listwise assegna un punteggio a ogni candidato in un singolo passaggio in avanti (forward pass), quindi l'auto-attenzione completa su una lista di 100 documenti cresce in modo quadratico e gonfia la KV cache. La soluzione ovvia è l'attenzione a finestra scorrevole. Con l'interazione LBNL, la soluzione ovvia rompe il modello.
Nell'LBNL, la query e tutti i candidati formano un'unica sequenza causale e il 词元 (token) di embedding della query si trova alla fine. Deve prestare attenzione fino al primo candidato per costruire una rappresentazione consapevole dei documenti incrociati. Una finestra finita interrompe tale dipendenza. Pertanto, fissiamo costantemente l'ultimo strato su globale, in modo che i 词元 (token) di embedding della query e del documento osservino l'intero contesto dei candidati al momento dell'estrazione. Sostituire quello strato con una finestra scorrevole degrada gravemente il ranking listwise; mantenerlo globale preserva la codifica congiunta senza uno stack completamente globale.
Per i restanti 27 strati abbiamo cercato pianificazioni 1L1G, 1L2G, 3L2G e 5L1G. Ha vinto 3L2G: tre strati a finestra scorrevole seguiti da due strati globali, ripetuti, ottenendo 17 strati locali e 11 globali con una finestra di 1.024 词元 (token). Gli strati locali riducono il costo dell'attenzione da O(L²) a O(L·w), mentre gli strati globali ogni tre passaggi aggiornano il segnale inter-candidato a lungo raggio a ogni profondità. Pianificazioni più dense non hanno prodotto alcun vantaggio in termini di throughput; la pianificazione più aggressiva 5L1G ha mostrato risultati peggiori su attività complesse multi-documento.

tagAuto-distillazione attraverso un gap di attenzione
La distillazione qui è insolita. Non riduciamo un grande modello in uno piccolo. Teacher e student sono entrambi da 0.6B e differiscono solo per il pattern di attenzione. Il teacher esegue un'attenzione completa a costo quadratico; lo student esegue 3L2G.
Forzare uno student a cambiare le maschere di attenzione e allo stesso tempo corrispondere agli output del teacher lo porta a fallire in entrambi, quindi la ricetta disaccoppia le due pressioni:
- Stadio I — teacher full-attention. Partendo dal checkpoint pubblico jina-reranker-v3, effettuiamo un fine-tuning completo di un teacher senza restrizioni di finestra scorrevole sull'intero set di dati v3.5. Stabilisce il limite massimo di qualità per questo budget di parametri.
- Stadio II — adattamento sparse-attention. Lo student si inizializza dai pesi dello Stadio I e attiva il 3L2G. Per prima cosa addestriamo solo le proiezioni dell'attenzione con tutto il resto bloccato, insegnando alle maschere sparse a instradare le informazioni senza disturbare le rappresentazioni apprese sotto l'attenzione completa. Successivamente sblocchiamo tutto in modo che lo student si riallinei alla nuova geometria dell'attenzione. Lo student è già distribuibile e più veloce a questo punto, ma rimane un gap coerente rispetto al teacher su BEIR, RTEB-legal e MIRACL.
- Stadio III — distillazione guidata dal teacher. Con il teacher bloccato, allineiamo lo student su quattro livelli contemporaneamente: un KL listwise su distribuzioni di punteggio normalizzate tramite softmax, un MSE sui punteggi assoluti, un MSE sugli stati nascosti dell'ultimo layer e una perdita di coseno sui vettori proiettati, oltre a regolarizzatori di similarità e dispersione in-context.
L'ordine è importante. Il solo Stadio II lascia un divario evidente perché lo student deve cambiare il proprio routing sotto una maschera più debole prima di poter imitare in modo sicuro i punteggi e gli stati del teacher. Lo Stadio III recupera quindi gran parte di quel divario, il che dimostra che la capacità della full-attention viene trasferita in uno student sparso una volta che la geometria si è adattata. La ricetta è scritta per 3L2G, ma lo schema si generalizza ad altri disallineamenti della programmazione dell'attenzione.
tagDati di addestramento
Il mix v3 copriva bene il recupero generale e meno bene i domini specializzati. Invece di aggiungere più dati, abbiamo eseguito un'analisi degli errori sui set di sviluppo RTEB e STARK e costruito ogni nuovo shard per coprire esattamente i pattern di recupero su cui falliscono i modelli generici. Gli hard negative provengono da diversi sistemi di recupero contemporaneamente (BM25, Jina, BGE, GTE, E5, ColBERT) in modo che il modello non possa imparare le scorciatoie di un singolo sistema.
Lo shard legale combina EUR-Lex multilingue, CLERC, AILA, giurisprudenza canadese, riassunti di casi svizzeri ed EuroVoc, sovracampionati perché il testo legale è denso di citazioni e lungo. Lo shard medico mira alla terminologia clinica e a passaggi ricchi di entità. Lo shard finanziario dà priorità a rivendicazioni numeriche, linguaggio normativo e passaggi che includono tabelle. La copertura multilingue si estende oltre MIRACL e mMARCO con WebFAQ in oltre 50 lingue, negativi cross-lingue SWIM-IR e coppie giapponesi Ruri-v3.
I dati strutturati hanno ottenuto il peso di campionamento più elevato, perché si trovano al di fuori della distribuzione di testo libero presupposta dai benchmark standard. La rilevanza su record e tabelle dipende da uguaglianza, limiti numerici e di data, appartenenza a liste e combinazioni logiche tra campi, non dalla sovrapposizione lessicale. Le prime esecuzioni sono state le peggiori qui, quindi abbiamo sintetizzato direttamente coppie ad alto vincolo.

tagRisultati sperimentali
Tutti i numeri classificano nuovamente i primi 100 candidati da jina-embeddings-v5-text-small sotto un'unica pipeline MTEB v2 unificata, quindi potrebbero differire leggermente dalle cifre riportate dal fornitore. Le tabelle complete per set di dati e per lingua sono presenti nel documento.
| Modello | Parametri | BEIR | MIRACL | RTEB | Struct-IR |
|---|---|---|---|---|---|
| jina-embeddings-v5-text-small (1° stadio) | 0.5B | 56.26 | 65.15 | 64.60 | – |
| mxbai-rerank-base-v2 | 0.5B | 59.58 | 64.90 | 61.44 | 30.4 |
| Qwen3-Reranker-0.6B | 0.6B | 56.94 | 67.12 | 68.41 | 41.9 |
| mxbai-rerank-large-v2 | 1.5B | 62.45 | 69.65 | 70.81 | 43.0 |
| Qwen3-Reranker-4B | 4.0B | 62.28 | 76.56 | 77.68 | 55.6 |
| jina-reranker-v3 | 0.6B | 62.10 | 72.20 | 68.01 | 38.7 |
| <strong>jina-reranker-v3.5</strong> | 0.6B | 63.20 | 74.11 | 70.95 | 48.3 |
La v3.5 migliora rispetto alla v3 in ogni famiglia di benchmark a parità di conteggio di parametri, con il guadagno maggiore nel recupero semi-strutturato.
I guadagni in RTEB si concentrano dove era mirato il mix: AILA-Statute migliora di 14,0 punti e AILA-Case di 11,7 rispetto alla v3, e FinQA raggiunge 86,91, il migliore tra tutti i modelli testati. Su STARK, la v3.5 migliora rispetto alla v3 in tutte e tre le metriche ufficiali e ottiene il miglior Hit@5 complessivo.
Una nota di protocollo su Struct-IR. Il benchmark indicizza milioni di oggetti per schema e il Recall@5 dell'in-schema al primo stadio è di circa 0,04, quindi il recupero end-to-end "retrieve-then-rerank" è quasi interamente limitato dal richiamo e distingue male i 重排器. Abbiamo invece inserito tutti i documenti "gold" insieme ai 30 distrattori più difficili del primo stadio, il che isola la discriminazione con vincoli di campo dalla copertura di recupero. I numeri sotto quel pool non sono confrontabili con la classifica di recupero SSRB.
tagEfficienza
Misurata su una singola NVIDIA A100, batch size 1, input listwise top-100, FlashAttention-2.


Poiché il reranking listwise in produzione è dominato da un singolo prefill su un nuovo set di candidati, queste riduzioni si traducono direttamente in liste di candidati più lunghe e documenti più grandi a parità di budget di servizio.
tagIniziare
tagTramite Jina Search Foundation API
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-reranker-v3.5",
"query": "scarpe da trail running sotto i 150$, valutazione 4.5+, rilasciate dal 2022",
"documents": [
"...",
"..."
],
"return_documents": false
}'tagTramite Elastic Inference Service
jina-reranker-v3.5 è disponibile su Elastic Inference Service (EIS) dallo Stack 9.3, quindi è possibile eseguire il reranking su GPU gestite senza ospitare il modello autonomamente. Crea un endpoint di inferenza che faccia riferimento al modello, quindi chiamalo come qualsiasi altra attività di rerank.
PUT _inference/rerank/eis-jina-reranker-v3-5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-reranker-v3.5"
}
}POST _inference/rerank/eis-jina-reranker-v3-5
{
"query": "scarpe da trail running sotto i 150$, valutazione 4.5+, rilasciate dal 2022",
"input": [
"...",
"..."
]
}La risposta restituisce un array rerank ordinato per rilevanza, ogni voce riporta l'indice originale del candidato e il suo punteggio. Poiché si tratta di un endpoint di inferenza standard, l'inference_id può essere referenziato direttamente da un retriever text_similarity_reranker in una query di ricerca.
tagTramite transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3.5',
dtype="auto",
trust_remote_code=True,
)
model.eval()
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains catechins that may help reduce inflammation.",
"El precio del cafe ha aumentado un 20% este ano.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
"Le the vert est riche en antioxydants.",
]
for r in model.rerank(query, documents):
print(f"{r['relevance_score']:.4f} {r['document'][:70]}")tagConclusione
La pretesa pratica di jina-reranker-v3.5 è circoscritta e verificabile: con 0,6 miliardi di parametri, un addestramento mirato colma gran parte del divario rispetto a un Reranker generalista da 4 miliardi di parametri, arrivando ad azzerarlo completamente sul benchmark BEIR, il tutto con una velocità di esecuzione superiore al modello che sostituisce. Per il recupero informazioni in ambito aziendale, ciò depone a favore dell'investimento in una supervisione focalizzata su una dorsale compatta, piuttosto che sull'utilizzo predefinito del modello più grande disponibile.
Due limitazioni meritano di essere esposte chiaramente. I Reranker di tipo listwise presentano ancora vincoli di input che i modelli pointwise e a interazione tardiva evitano, in particolare limiti superiori fissi sul numero di candidati e sulla lunghezza totale dei candidati. Inoltre, permangono lacune significative rispetto al modello Qwen da 4 miliardi di parametri nei compiti legali e medici del benchmark RTEB, nello Struct-IR con pool controllato e nelle lingue a basse risorse del benchmark MIRACL. Si tratta di casi complessi, che preferiamo nominare esplicitamente piuttosto che nascondere dietro una media statistica.






