Panoramica
jina-reranker-v1-turbo-en è un reranker cross-encoder inglese da 37,8M parametri che consegna il 95 % della precisione del modello base elaborando i documenti tre volte più velocemente e usando il 75 % in meno di memoria. È stato progettato per i sistemi di ricerca di produzione in cui il compromesso qualità-latenza dei cross-encoder completi era impraticabile, offrendo una via pratica verso il raffinamento della ricerca su larga scala.
Metodi
Il modello comprime l'architettura BERT a 12 layer del reranker base in un design a sei layer con 37,8M parametri (contro 137M per base). Mantiene il meccanismo centrale di cross-attention basato su BERT per le interazioni a livello di token tra query e documento, ma ottimizza la velocità attraverso il numero ridotto di layer e un'allocazione efficiente dei parametri. Il training usa la distillazione di conoscenza: il modello base più grande agisce come insegnante, guidando la variante turbo a eguagliare il suo comportamento di ranking con meno parametri. Il modello supporta sequenze fino a 8.192 token attraverso le codifiche posizionali ALiBi, abilitando l'analisi esaustiva dei documenti mantenendo un'inferenza rapida.
Prestazione
Su BEIR, la variante turbo raggiunge un NDCG@10 di 49,60, conservando il 95 % delle performance del modello base (52,45) mentre supera bge-reranker-base (47,89, 278M parametri). Nelle applicazioni RAG, mantiene un hit rate dell'83,51 % e 0,6498 MRR. Il vantaggio di velocità è sostanziale: tre volte più veloce del modello base, con throughput che scala quasi linearmente con la riduzione del numero di parametri. I requisiti di memoria calano da 550MB (base) a 150MB (turbo), abilitando il deploy su istanze più piccole e significativi risparmi di costo negli ambienti cloud. La degradazione delle performance è minima nella maggior parte dei task, con punteggi leggermente inferiori su scenari di ranking estremamente sfumati.
Orientamento
Implementa una pipeline in due fasi: la ricerca vettoriale fornisce i candidati iniziali, poi questo modello riordina i top 100–200. Il punto ottimale per la maggior parte delle applicazioni è il ri-ranking di 100–200 candidati per query, bilanciando qualità e velocità. Il modello è solo inglese; per applicazioni multilingua, usa jina-reranker-v2-base-multilingual o jina-reranker-v3.5. Richiede hardware con supporto CUDA, ma funziona su istanze più piccole del modello base (150MB contro 550MB di memoria GPU). Disponibile tramite Jina Reranker API e AWS SageMaker. Per nuovi progetti, jina-reranker-v3.5 (multilingua, listwise, contesto 131K) è la scelta raccomandata. Quando la latenza è il vincolo principale, il vantaggio di velocità 3× di questo modello lo rende adatto alle applicazioni di ricerca in tempo reale.





