Panoramica
jina-reranker-v1-base-en è un reranker cross-encoder inglese da 137M parametri che affina i risultati di ricerca eseguendo un'analisi a livello di token delle coppie query-documento. Offre un miglioramento del 20 % della precisione di ricerca rispetto alla ricerca vettoriale di base, rendendolo il cavallo di battaglia della prima generazione di reranker di Jina. Ora è superato dalle famiglie multilingua v2 e listwise v3.
Metodi
Il modello impiega un'architettura cross-attention basata su BERT (12 layer, 12 teste di attenzione, 768 dimensioni nascoste, 137M parametri) che differisce fondamentalmente dagli approcci basati su embedding. Invece di confrontare embedding di documenti precalcolati, esegue interazioni dinamiche a livello di token tra query e documento, catturando le sfumature contestuali che la similarità coseno perde. La finestra di contesto di 1.024 token supporta chunking automatico e max-pooling attraverso i chunk per documenti più lunghi. L'addestramento ha usato una perdita contrastiva su coppie di pertinenza query-documento con mining di negativi difficili. Il modello è stato il primo reranker di Jina e ha stabilito il modello per le varianti turbo e tiny mediante distillazione di conoscenza.
Prestazione
Il modello ottiene un aumento dell'8 % del hit rate e un miglioramento del 33 % del rango reciproco medio rispetto alla ricerca vettoriale di base. Su BEIR, ottiene una media di NDCG@10 di 0,5588, superando BGE (0,5032), BCE (0,4969) e Cohere (0,5141). Sul benchmark LoCo per la comprensione di lungo contesto, ottiene 0,873, nettamente davanti ai concorrenti. Mostra una forza particolare sul contenuto tecnico: 0,996 sugli abstract QASPER e 0,962 sull'analisi di rapporti governativi, anche se la performance è inferiore (0,466) sui task di sintesi di riunioni. La latenza scala con la lunghezza del documento: 156 ms per 256 token, 7.068 ms per 4.096 token con una query di 512 token.
Orientamento
Implementa una pipeline in due fasi: la ricerca vettoriale (es. jina-embeddings-v5-text-small) fornisce i candidati iniziali, poi questo modello riordina i top 100–200 per precisione. Il modello è solo inglese — per applicazioni multilingua, usa jina-reranker-v2-base-multilingual o jina-reranker-v3.5. Richiede hardware con supporto CUDA per il throughput di produzione. Per nuovi progetti, preferisci jina-reranker-v3.5 (multilingua, listwise, contesto 131K, 63,20 BEIR NDCG@10). Il modello è disponibile tramite Jina Reranker API, AWS SageMaker e Hugging Face. Durante l'integrazione con sistemi RAG, regola il numero di documenti inviati per il ri-ranking in base ai requisiti di latenza — 100–200 documenti bilanciano tipicamente qualità e velocità.










