Grafico I/O

multiplo

Documento

Domanda

jina-reranker-v3

Classifica

Frontiera di Pareto
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-colbert-v2jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-reranker-v3Parametri (log)nDCG@10
Questo modello
Sulla frontiera
Jina AI
Altri
MIRACL
72.20
Parametri
597M
Classifica per punteggio
5 / 17
Frontiera di Pareto
Dietro
Distribuzione dei valori
AUC 0.8396
Corpus
Coppie di traduzione
Ricerca documentale
Codice
0.020-0.200.000.200.400.60
Correlate62.2%
Negativo difficile18.2%
Non correlate9.5%
Soglie consigliate
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
bilanciata · -0.008
AUC
0.8396
Soglia del rumore
0.414
Crollo del richiamo
-0.185
Coppie misurate
119 / 2.856
Punteggio per posizione
12345678910
Punteggio medio a ogni posizione
Chi vince la prima posizione
Una corrispondenza corretta vince il 45% di 119 query
Sensibilità al pool
Posizione nella lista0.161
Dimensione del pool0.088
Difficoltà dei riempitivi0.015
Massima oscillazione di punteggio sulla stessa coppia
Scegli i modelli da confrontare
Pubblicazioni (1)

Panoramica

jina-reranker-v3 è un reranker listwise multilingue da 597M parametri che introduce l'interazione 'last but not late' (LBNL) — un cambio di paradigma rispetto al scoring cross-encoder a coppie. Invece di valutare ogni coppia query-documento in isolamento, elabora un'intera lista di documenti candidati simultaneamente all'interno di una singola finestra di contesto di 131K token, usando l'attenzione causale per catturare le relazioni tra documenti. Raggiunge una performance BEIR state-of-the-art (61,94 NDCG{'@'}10) con 2,5× meno parametri rispetto al concorrente più vicino.

Metodi

L'innovazione centrale è l'architettura LBNL. In un cross-encoder standard, ogni coppia query-documento viene punteggiata indipendentemente. In un modello a interazione tardiva (ColBERT), i documenti vengono codificati separatamente e abbinati token per token. LBNL combina i punti di forza di entrambi: la query e tutti i documenti candidati condividono un singolo contesto di attenzione causale, consentendo al modello di fare attenzione tra i documenti e catturare segnali di rilevanza relativa che il scoring a coppie trascura. Il modello elabora fino a 16 documenti per forward pass (uno positivo e 15 negativi durante l'addestramento), con ogni documento troncato a una lunghezza fissa. Gli embedding vengono estratti dall'ultimo token di ogni documento tramite Last-Token-Pooling, sfruttando il meccanismo di attenzione causale per aggregare naturalmente le informazioni dal contesto precedente. La finestra di contesto di 131K token è abilitata tramite embedding posizionali rotativi con frequenze base regolate. L'addestramento utilizza un curriculum progressivo in tre fasi con una perdita multi-obiettivo che combina InfoNCE, perdita dispersiva (peso 0,45), perdita di matching duale (peso 0,85) e perdita di similarità.

Prestazione

Sul BEIR, il modello raggiunge 61,94 NDCG{'@'}10, il più alto tra tutti i reranker valutati e un miglioramento del 4,88 % rispetto a jina-reranker-v2. Eccelle nella retrieval multi-hop (78,56 su HotpotQA) e nella verifica di fatti (93,95 su FEVER). Le prestazioni multilingua raggiungono 66,50 su MIRACL su 18 lingue, con 78,69 in arabo e 81,06 in tailandese. La retrieval di codice raggiunge 63,28 su CoIR. Supera il mxbai-rerank-large da 1,5B (61,44) con 2,5× meno parametri e mostra un miglioramento del 5,43 % rispetto a bge-reranker-v2-m3 alla stessa scala. La performance è relativamente stabile attraverso gli ordinamenti dei documenti: casuale (62,54), decrescente (61,94), crescente (61,52) — indicando uno scoring listwise robusto indipendente dall'ordinamento dei candidati.

Orientamento

Usa il template di prompt strutturato con i ruoli system/user/assistant e token speciali per l'estrazione degli embedding. Elabora fino a 64 documenti per forward pass per le collection che superano il contesto di 131K. Ottimale con i documenti ordinati casualmente o per rilevanza decrescente (la differenza di performance è <1 %). Sfrutta la capacità di interazione tra documenti per i task di ranking comparativo — il design listwise del modello cattura le relazioni tra candidati che lo scoring a coppie trascura. Per le applicazioni multilingua, il modello offre un solido transfer zero-shot su 18 lingue. Implementa l'elaborazione batch per grandi insiemi di documenti, mantenendo gli embedding di query coerenti tra i batch. Gli embedding di output a 256 dimensioni supportano un calcolo di similarità efficiente. Ideale per i task di ragionamento multi-hop e verifica di fatti. Per la produzione, usa jina-reranker-v3.5 per un'inferenza 1,22–1,56× più veloce tramite l'attenzione ibrida.

Blog che menzionano questo modello