Jina AI sta annunciando nuovi modelli nella sua famiglia di modelli reranker all'avanguardia, ora disponibili su AWS Sagemaker e Hugging Face: jina-reranker-v1-turbo-en e jina-reranker-v1-tiny-en. Questi modelli danno priorità alla velocità e alle dimensioni mantenendo alte prestazioni sui benchmark standard, offrendo un processo di reranking più veloce e più efficiente in termini di memoria per ambienti dove il tempo di risposta e l'uso delle risorse sono critici.



Reranker Turbo e Tiny sono ottimizzati per tempi di risposta estremamente rapidi nelle applicazioni di recupero delle informazioni. Come i nostri modelli di embedding, utilizzano l'architettura JinaBERT, una variante dell'architettura BERT potenziata con una variante bidirezionale simmetrica di ALiBi. Questa architettura permette il supporto di lunghe sequenze di testo, con i nostri modelli che accettano fino a 8.192 token, ideali per l'analisi approfondita di documenti più grandi e query complesse che richiedono una comprensione dettagliata del linguaggio.
I modelli Turbo e Tiny si basano sulle intuizioni acquisite da Jina Reranker v1. Il reranking può essere un importante collo di bottiglia per le applicazioni di recupero delle informazioni. Le applicazioni di ricerca tradizionali sono una tecnologia molto matura le cui prestazioni sono ben comprese. I reranker aggiungono molta precisione al recupero basato sul testo, ma i modelli AI sono grandi e possono essere lenti e costosi da eseguire.
Molti utenti preferirebbero un modello più piccolo, più veloce e più economico, anche se ciò comporta qualche costo in termini di accuratezza. Avere un unico obiettivo – il reranking dei risultati di ricerca – rende possibile ottimizzare il modello e offrire agli utenti prestazioni competitive in modelli molto più compatti. Utilizzando meno strati nascosti, velocizziamo l'elaborazione e riduciamo le dimensioni del modello. Questi modelli costano meno da eseguire, e la maggiore velocità li rende più utili per applicazioni che non possono tollerare molta latenza, mantenendo quasi tutte le prestazioni dei modelli più grandi.
In questo articolo, vi mostreremo l'architettura di Reranker Turbo e Reranker Tiny, ne misureremo le prestazioni e vi mostreremo come iniziare a utilizzarli.
tagArchitettura Ottimizzata
Jina Reranker Turbo (jina-reranker-v1-turbo-en) utilizza un'architettura a sei strati, con un totale di 37,8 milioni di parametri, in contrasto con i 137 milioni di parametri e i dodici strati del modello reranker base jina-reranker-v1-base-en. Questo rappresenta una riduzione delle dimensioni del modello di tre quarti e un aumento della velocità di elaborazione fino al triplo.
Reranker Tiny (jina-reranker-v1-tiny-en) utilizza quattro strati con 33 milioni di parametri, fornendo un'elaborazione parallela ancora maggiore e velocità più elevate – quasi cinque volte più veloce del modello Reranker base – risparmiando al contempo il 13% dei costi di memoria rispetto al modello Turbo.

tagKnowledge Distillation
Abbiamo addestrato Reranker Turbo e Tiny utilizzando la knowledge distillation. Questa è una tecnica che utilizza un modello AI esistente per addestrarne un altro a replicare il suo comportamento. Invece di utilizzare fonti di dati esterne, utilizziamo un modello esistente per generare dati per l'addestramento. Abbiamo utilizzato il modello Jina Reranker base per classificare collezioni di documenti e poi abbiamo utilizzato questi risultati per addestrare sia Turbo che Tiny. In questo modo, possiamo introdurre molti più dati nel processo di addestramento perché non siamo limitati dai dati disponibili nel mondo reale.
È un po' come uno studente che impara da un insegnante: il modello già addestrato e ad alte prestazioni – il modello Jina Reranker Base – "insegna" ai modelli non addestrati Jina Turbo e Jina Tiny generando nuovi dati di addestramento. Questa tecnica è ampiamente utilizzata per creare modelli piccoli da quelli grandi. Al suo meglio, la differenza nelle prestazioni tra il modello "insegnante" e lo "studente" può essere molto piccola.
tagValutazione su BEIR
I benefici dell'ottimizzazione e della knowledge distillation comportano un costo relativamente basso in termini di qualità delle prestazioni. Sul benchmark BEIR per il recupero delle informazioni, jina-reranker-v1-turbo-en ottiene poco meno del 95% dell'accuratezza di jina-reranker-v1-base-en, e jina-reranker-v1-tiny-en ottiene il 92,5% del punteggio del modello base.
Tutti i modelli Jina Reranker sono competitivi con altri popolari modelli reranker, la maggior parte dei quali ha dimensioni molto maggiori.
| Model | BEIR Score (NDCC@10) | Parameters |
|---|---|---|
| Jina Reranker models | ||
| jina-reranker-v1-base-en | 52.45 | 137M |
| jina-reranker-v1-turbo-en | 49.60 | 38M |
| jina-reranker-v1-tiny-en | 48.54 | 33M |
| Other reranking models | ||
mxbai-rerank-base-v1 |
49.19 | 184M |
mxbai-rerank-xsmall-v1 |
48.80 | 71M |
ms-marco-MiniLM-L-6-v2 |
48.64 | 23M |
bge-reranker-base |
47.89 | 278M |
ms-marco-MiniLM-L-4-v2 |
47.81 | 19M |
NDCC@10: Punteggi calcolati utilizzando il Normalized Discounted Cumulative Gain per i primi 10 risultati.

Solo MiniLM-L6 (ms-marco-MiniLM-L-6-v2) e MiniLM-L4 (ms-marco-MiniLM-L-4-v2) hanno dimensioni e velocità comparabili, con jina-reranker-v1-turbo-en e jina-reranker-v1-tiny-en che offrono prestazioni paragonabili o significativamente migliori.
Otteniamo risultati simili nel LlamaIndex RAG Benchmark. Abbiamo testato tutti e tre i Jina Reranker in una configurazione RAG utilizzando tre modelli di embedding per la ricerca vettoriale (jina-embeddings-v2-base-en, bge-base-en-v1.5, e Cohere-embed-english-v3.0) e calcolato la media dei punteggi.
| Reranker Model | Avg. Hit Rate | Avg. MRR |
|---|---|---|
| Jina Reranker models | ||
| jina-reranker-v1-base-en | 0.8439 | 0.7006 |
| jina-reranker-v1-turbo-en | 0.8351 | 0.6498 |
| jina-reranker-v1-tiny-en | 0.8316 | 0.6761 |
| Other reranking models | ||
mxbai-rerank-base-v1 |
0.8105 | 0.6583 |
mxbai-rerank-xsmall-v1 |
0.8193 | 0.6673 |
ms-marco-MiniLM-L-6-v2 |
0.8052 | 0.6121 |
bge-reranker-base |
0.8175 | 0.6480 |
ms-marco-MiniLM-L-4-v2 |
0.8246 | 0.6354 |
MRR: Mean Reciprocal Rank
Per le attività di retrieval-augmented generation (RAG), le perdite nella qualità dei risultati sono persino minori rispetto al benchmark BEIR di pura information retrieval. E quando le prestazioni RAG vengono confrontate con la velocità di elaborazione, vediamo che solo ms-marco-MiniLM-L-4-v2 fornisce un throughput significativamente maggiore, a un costo significativo in termini di qualità dei risultati.

tagRisparmi sui Costi su AWS
L'utilizzo di Reranker Turbo e Reranker Tiny fornisce notevoli risparmi per gli utenti AWS e Azure che pagano per l'utilizzo della memoria e il tempo CPU. Sebbene l'entità dei risparmi vari per diversi casi d'uso, la riduzione di circa il 75% nell'utilizzo della memoria corrisponde direttamente a un risparmio del 75% per i sistemi cloud che addebitano l'uso della memoria.
Inoltre, il throughput più veloce significa che è possibile eseguire più query su istanze AWS più economiche.
tagPer Iniziare
I modelli Jina Reranker sono facili da utilizzare e integrare nelle tue applicazioni e flussi di lavoro. Per iniziare, puoi visitare la pagina dell'API Reranker per vedere come utilizzare il nostro servizio e ottenere 1 milione di token gratuiti per provarlo tu stesso.

I nostri modelli sono anche disponibili in AWS SageMaker. Per maggiori informazioni, consulta il nostro tutorial su come configurare un sistema di retrieval-augmented generation in AWS.


I modelli Jina Reranker sono anche disponibili per il download sotto la licenza Apache 2.0 da Hugging Face:








