Grafico I/O
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
BEIR
62.10
Parameters
597M
Rank by score
4 / 21
Pareto front
Behind it
Distribuzione dei valorihelp_outlineAUC 0.8396
Corpus
Coppie di traduzione
Ricerca documentale
Codice
Correlate62.2%
Negativo difficile18.2%
Non correlate9.5%
Soglie consigliate
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
bilanciata · -0.008
AUC
0.8396
Soglia del rumore
0.414
Crollo del richiamo
-0.185
Coppie misurate
119 / 2,856
Punteggio per posizionehelp_outline
Punteggio medio a ogni posizione
Chi vince la prima posizionehelp_outline
Una corrispondenza corretta vince il 45% di 119 query
Sensibilità al poolhelp_outline
Posizione nella lista0.161
Dimensione del pool0.088
Difficoltà dei riempitivi0.015
Massima oscillazione di punteggio sulla stessa coppia
Scegli i modelli da confrontare
Pubblicazioni (1)
Panoramica
jina-reranker-v3 è un reranker di documenti multilingue con 0,6 miliardi di parametri che introduce una nuova architettura di interazione "last but not late". A differenza della codifica separata di ColBERT con corrispondenza multi-vettore, questo modello esegue l'auto-attenzione causale tra query e documenti all'interno della stessa finestra di contesto, consentendo interazioni tra documenti complesse prima di estrarre gli embedding contestuali dall'ultimo token di ciascun documento. Basato su Qwen3-0.6B con 28 livelli di trasformazione e un proiettore MLP leggero (1024→512→256), elabora fino a 64 documenti simultaneamente in un contesto di 131K token. Il modello raggiunge prestazioni BEIR all'avanguardia con 61,94 nDCG-10, pur essendo 10 volte più piccolo dei reranker generativi listwise.
Metodi
Utilizza un addestramento progressivo a tre fasi con perdita multi-obiettivo che combina InfoNCE, perdita dispersiva (0,45), perdita di corrispondenza duale (0,85) e perdita di similarità (0,85). La fase 1 utilizza la messa a punto LoRA (r=16, α=32) su set di dati specifici del dominio, tra cui BGE-M3 e Cornstack, con 16 documenti per query. La fase 2 estende il contesto a 8.192 token ed estrae negativi rigidi su sistemi di recupero con un massimo di 25 negativi a τ=0,05. La fase 3 unisce modelli specializzati con pesi compresi tra 0,25 e 0,65. I token speciali doc_emb e query_emb contrassegnano le posizioni di estrazione dell'embedding. L'addestramento utilizza prompt strutturati con ruoli di sistema/utente/assistente, posizionando la query sia all'inizio che alla fine per un'attenzione bidirezionale.
Prestazione
Raggiunge 61,94 nDCG-10 su BEIR, il più alto tra tutti i reranker valutati e un miglioramento del 4,88% rispetto a jina-reranker-v2. Eccelle nel recupero multi-hop con 78,56 su HotpotQA, mentre la verifica dei fatti raggiunge 93,95 su FEVER. Le prestazioni multilingue raggiungono 66,50 su MIRACL in 18 lingue, con l'arabo a 78,69 e il tailandese a 81,06. Il recupero del codice raggiunge 63,28 su CoIR. Supera mxbai-rerank-large da 1,5B (61,44) con 2,5 volte meno parametri. Mostra un miglioramento del 5,43% rispetto a bge-reranker-v2-m3 a pari scala. Relativamente stabile tra gli ordinamenti dei documenti: casuale (62,54), decrescente (61,94), crescente (61,52).
Orientamento
Utilizza un modello di prompt strutturato con ruoli di sistema/utente/assistente e token speciali per l'estrazione tramite incorporamento. Elabora fino a 64 documenti per passaggio di avanzamento per raccolte con contesto superiore a 131K. Ottimale con documenti ordinati in modo casuale o per rilevanza decrescente. Sfrutta la capacità di interazione tra documenti per attività di ranking comparativo. Per applicazioni multilingue, il modello fornisce un trasferimento zero-shot affidabile in 18 lingue. Implementa l'elaborazione batch per set di documenti di grandi dimensioni, mantenendo gli incorporamenti delle query in modo coerente tra i batch. Considera gli incorporamenti di output a 256 dimensioni per un calcolo efficiente della similarità. Ideale per applicazioni che richiedono sia qualità del ranking che efficienza di inferenza, in particolare attività di ragionamento multi-hop e verifica dei fatti.
Blog che menzionano questo modello








