Grafico I/O

multiplo

Documento

Domanda

jina-reranker-v1

Classifica

Frontiera di Pareto
30M100M300M0.810.820.830.84bge-reranker-basejina-reranker-v1-base-enjina-reranker-v1-tiny-enms-marco-MiniLM-L-4-v2ms-marco-MiniLM-L-6-v2mxbai-rerank-base-v1mxbai-rerank-xsmall-v1jina-reranker-v1-turbo-…Parametri (log)hit-rate
Questo modello
Sulla frontiera
Jina AI
Altri
LlamaIndex RAG · avg3emb
0.835
Parametri
38M
Classifica per punteggio
2 / 8
Frontiera di Pareto
Sulla
Distribuzione dei valori
AUC 0.8287
Corpus
Coppie di traduzione
0.4800.000.200.400.600.80
Correlate29.0%
Negativo difficile7.0%
Non correlate1.1%
Soglie consigliate
FPR 0.1 · 0.223
FPR 0.01 · 0.480
FPR 0.001 · 0.753
FPR 0.0001 · 0.959
bilanciata · 0.083
AUC
0.8287
Soglia del rumore
0.731
Crollo del richiamo
0.019
Coppie misurate
100 / 9.200
Punteggio per posizione
12345678910
Punteggio medio a ogni posizione
Scegli i modelli da confrontare

Panoramica

jina-reranker-v1-turbo-en è un reranker cross-encoder inglese da 37,8M parametri che consegna il 95 % della precisione del modello base elaborando i documenti tre volte più velocemente e usando il 75 % in meno di memoria. È stato progettato per i sistemi di ricerca di produzione in cui il compromesso qualità-latenza dei cross-encoder completi era impraticabile, offrendo una via pratica verso il raffinamento della ricerca su larga scala.

Metodi

Il modello comprime l'architettura BERT a 12 layer del reranker base in un design a sei layer con 37,8M parametri (contro 137M per base). Mantiene il meccanismo centrale di cross-attention basato su BERT per le interazioni a livello di token tra query e documento, ma ottimizza la velocità attraverso il numero ridotto di layer e un'allocazione efficiente dei parametri. Il training usa la distillazione di conoscenza: il modello base più grande agisce come insegnante, guidando la variante turbo a eguagliare il suo comportamento di ranking con meno parametri. Il modello supporta sequenze fino a 8.192 token attraverso le codifiche posizionali ALiBi, abilitando l'analisi esaustiva dei documenti mantenendo un'inferenza rapida.

Prestazione

Su BEIR, la variante turbo raggiunge un NDCG{'@'}10 di 49,60, conservando il 95 % delle performance del modello base (52,45) mentre supera bge-reranker-base (47,89, 278M parametri). Nelle applicazioni RAG, mantiene un hit rate dell'83,51 % e 0,6498 MRR. Il vantaggio di velocità è sostanziale: tre volte più veloce del modello base, con throughput che scala quasi linearmente con la riduzione del numero di parametri. I requisiti di memoria calano da 550MB (base) a 150MB (turbo), abilitando il deploy su istanze più piccole e significativi risparmi di costo negli ambienti cloud. La degradazione delle performance è minima nella maggior parte dei task, con punteggi leggermente inferiori su scenari di ranking estremamente sfumati.

Orientamento

Implementa una pipeline in due fasi: la ricerca vettoriale fornisce i candidati iniziali, poi questo modello riordina i top 100–200. Il punto ottimale per la maggior parte delle applicazioni è il ri-ranking di 100–200 candidati per query, bilanciando qualità e velocità. Il modello è solo inglese; per applicazioni multilingua, usa jina-reranker-v2-base-multilingual o jina-reranker-v3.5. Richiede hardware con supporto CUDA, ma funziona su istanze più piccole del modello base (150MB contro 550MB di memoria GPU). Disponibile tramite Jina Reranker API e AWS SageMaker. Per nuovi progetti, jina-reranker-v3.5 (multilingua, listwise, contesto 131K) è la scelta raccomandata. Quando la latenza è il vincolo principale, il vantaggio di velocità 3× di questo modello lo rende adatto alle applicazioni di ricerca in tempo reale.

Blog che menzionano questo modello