Panoramica
jina-reranker-v3 è un reranker listwise multilingue da 597M parametri che introduce l'interazione 'last but not late' (LBNL) — un cambio di paradigma rispetto al scoring cross-encoder a coppie. Invece di valutare ogni coppia query-documento in isolamento, elabora un'intera lista di documenti candidati simultaneamente all'interno di una singola finestra di contesto di 131K token, usando l'attenzione causale per catturare le relazioni tra documenti. Raggiunge una performance BEIR state-of-the-art (61,94 NDCG@10) con 2,5× meno parametri rispetto al concorrente più vicino.
Metodi
L'innovazione centrale è l'architettura LBNL. In un cross-encoder standard, ogni coppia query-documento viene punteggiata indipendentemente. In un modello a interazione tardiva (ColBERT), i documenti vengono codificati separatamente e abbinati token per token. LBNL combina i punti di forza di entrambi: la query e tutti i documenti candidati condividono un singolo contesto di attenzione causale, consentendo al modello di fare attenzione tra i documenti e catturare segnali di rilevanza relativa che il scoring a coppie trascura. Il modello elabora fino a 16 documenti per forward pass (uno positivo e 15 negativi durante l'addestramento), con ogni documento troncato a una lunghezza fissa. Gli embedding vengono estratti dall'ultimo token di ogni documento tramite Last-Token-Pooling, sfruttando il meccanismo di attenzione causale per aggregare naturalmente le informazioni dal contesto precedente. La finestra di contesto di 131K token è abilitata tramite embedding posizionali rotativi con frequenze base regolate. L'addestramento utilizza un curriculum progressivo in tre fasi con una perdita multi-obiettivo che combina InfoNCE, perdita dispersiva (peso 0,45), perdita di matching duale (peso 0,85) e perdita di similarità.
Prestazione
Sul BEIR, il modello raggiunge 61,94 NDCG@10, il più alto tra tutti i reranker valutati e un miglioramento del 4,88 % rispetto a jina-reranker-v2. Eccelle nella retrieval multi-hop (78,56 su HotpotQA) e nella verifica di fatti (93,95 su FEVER). Le prestazioni multilingua raggiungono 66,50 su MIRACL su 18 lingue, con 78,69 in arabo e 81,06 in tailandese. La retrieval di codice raggiunge 63,28 su CoIR. Supera il mxbai-rerank-large da 1,5B (61,44) con 2,5× meno parametri e mostra un miglioramento del 5,43 % rispetto a bge-reranker-v2-m3 alla stessa scala. La performance è relativamente stabile attraverso gli ordinamenti dei documenti: casuale (62,54), decrescente (61,94), crescente (61,52) — indicando uno scoring listwise robusto indipendente dall'ordinamento dei candidati.
Orientamento
Usa il template di prompt strutturato con i ruoli system/user/assistant e token speciali per l'estrazione degli embedding. Elabora fino a 64 documenti per forward pass per le collection che superano il contesto di 131K. Ottimale con i documenti ordinati casualmente o per rilevanza decrescente (la differenza di performance è <1 %). Sfrutta la capacità di interazione tra documenti per i task di ranking comparativo — il design listwise del modello cattura le relazioni tra candidati che lo scoring a coppie trascura. Per le applicazioni multilingua, il modello offre un solido transfer zero-shot su 18 lingue. Implementa l'elaborazione batch per grandi insiemi di documenti, mantenendo gli embedding di query coerenti tra i batch. Gli embedding di output a 256 dimensioni supportano un calcolo di similarità efficiente. Ideale per i task di ragionamento multi-hop e verifica di fatti. Per la produzione, usa jina-reranker-v3.5 per un'inferenza 1,22–1,56× più veloce tramite l'attenzione ibrida.








