Panoramica
jina-reranker-v1-tiny-en è un reranker cross-encoder inglese da 33M parametri — il più piccolo della famiglia v1 di Jina. Grazie a una distillazione di conoscenza aggressiva, mantiene il 92,5 % della precisione del modello base elaborando i documenti cinque volte più velocemente e usando il 13 % in meno di memoria rispetto alla variante turbo. È progettato per edge computing, applicazioni mobile e sistemi di ricerca ad alto throughput con budget di latenza stretti.
Metodi
Il modello impiega un'architettura snella a quattro layer basata su JinaBERT con codifiche posizionali ALiBi bidirezionali simmetriche. Il suo sviluppo sfrutta la distillazione di conoscenza da jina-reranker-v1-base-en da 137M parametri, che funge da modello insegnante. Il modello studente impara comportamenti di ranking ottimali senza richiedere ampie dati di training del mondo reale, eguagliando le distribuzioni di ranking morbide dell'insegnante usando solo 33M parametri. Il design a quattro layer e le dimensioni nascoste ridotte abilitano l'accelerazione 5× rispetto al modello base. Il modello supporta contesto di 1.024 token con chunking automatico per documenti più lunghi.
Prestazione
Su BEIR, il modello raggiunge un NDCG@10 di 48,54, conservando il 92,5 % delle performance del modello base (52,45) mentre è solo un quarto della sua dimensione. Nei benchmark RAG di LlamaIndex, mantiene un hit rate dell'83,16 %, quasi alla pari di modelli più grandi elaborando i documenti significativamente più velocemente. Il throughput è quasi cinque volte più veloce del modello base, con il 13 % in meno di uso memoria rispetto alla variante turbo. Queste metriche reggono il confronto o superano modelli molto più grandi come mxbai-rerank-base-v1 (184M) e bge-reranker-base (278M). Il compromesso performance-dimensione lo rende particolarmente adatto ai deploy con risorse limitate.
Orientamento
Dai priorità agli scenari in cui velocità di elaborazione ed efficienza delle risorse sono critiche: edge computing, applicazioni mobile e sistemi di ricerca ad alto throughput con budget di latenza stretti. Per le applicazioni che richiedono la massima precisione di ranking assoluta, il modello base o jina-reranker-v3.5 è preferibile. Il modello richiede una GPU con supporto CUDA per le performance ottimali, ma funziona su hardware meno potente dei corrispettivi più grandi. Si integra con i principali database vettoriali e framework RAG ed è disponibile tramite Jina Reranker API e AWS SageMaker. Il modello è solo inglese; per applicazioni multilingua, usa jina-reranker-v2-base-multilingual o jina-reranker-v3.5. Durante il fine-tuning per domini specifici, bilancia attentamente la qualità dei dati di training con l'architettura compatta del modello per mantenere le caratteristiche di performance.





