Gráfico de E/S

múltiple

Documento

Consulta

jina-reranker-v3

Ranking

Frontera de Pareto
300M1B3.0B10B4050607080bge-m3 (multi-vector)bge-reranker-v2-gemmabge-reranker-v2-m3bge-reranker-v2.5-gemma…ColBERT-ZeroGTE-ModernColBERT-v1jina-colbert-v2jina-reranker-m0jina-reranker-v2-base-m…jina-reranker-v3.5LFM2.5-ColBERT-350Mmxbai-rerank-base-v2mxbai-rerank-large-v2PLAID-XQwen3-Reranker-0.6BQwen3-Reranker-4Bjina-reranker-v3Parámetros (log)nDCG@10
Este modelo
En la frontera
Jina AI
Otros
MIRACL
72.20
Parámetros
597M
Rango por score
5 / 17
Frontera de Pareto
Por detrás
Distribución de valores
AUC 0.8396
Corpus
Pares de traducción
Búsqueda documental
Código
0.020-0.200.000.200.400.60
Relacionados62.2%
Negativo difícil18.2%
No relacionados9.5%
Umbrales recomendados
FPR 0.1 · 0.020
FPR 0.01 · 0.238
FPR 0.001 · 0.424
FPR 0.0001 · 0.600
equilibrado · -0.008
AUC
0.8396
Techo de ruido
0.414
Caída de exhaustividad
-0.185
Pares medidos
119 / 2856
Puntuación por posición
12345678910
Puntuación media en cada posición
Qué gana el primer puesto
Una coincidencia correcta gana el 45 % de 119 consultas
Sensibilidad al conjunto
Posición en la lista0.161
Tamaño del conjunto0.088
Dificultad del relleno0.015
Mayor oscilación de puntuación en el mismo par
Elija modelos para comparar
Publicaciones (1)

Descripción general

jina-reranker-v3 es un reranker listwise multilingüe de 597M parámetros que introduce la interacción 'last but not late' (LBNL), un cambio de paradigma respecto al scoring de cross-encoder por pares. En lugar de evaluar cada par consulta-documento de forma aislada, procesa simultáneamente una lista completa de documentos candidatos dentro de una única ventana de contexto de 131K tokens, usando atención causal para capturar relaciones entre documentos. Logra un rendimiento BEIR líder (61,94 NDCG{'@'}10) con 2,5× menos parámetros que el competidor más cercano.

Métodos

La innovación central es la arquitectura LBNL. En un cross-encoder estándar, cada par consulta-documento se puntúa de forma independiente. En un modelo de interacción tardía (ColBERT), los documentos se codifican por separado y se comparan token por token. LBNL combina las fortalezas de ambos: la consulta y todos los documentos candidatos comparten una única ventana de atención causal, permitiendo que el modelo preste atención entre documentos y capture señales de relevancia relativa que el scoring por pares pasa por alto. El modelo procesa hasta 16 documentos por pasada hacia adelante (uno positivo y 15 negativos durante el entrenamiento), con cada documento truncado a una longitud fija. Los embeddings se extraen del token final de cada documento mediante Last-Token-Pooling, aprovechando el mecanismo de atención causal para agregar naturalmente información del contexto previo. La ventana de contexto de 131K tokens se habilita mediante embeddings posicionales rotatorios con frecuencias base ajustadas. El entrenamiento usa un currículo progresivo de tres etapas con una pérdida multiobjetivo que combina InfoNCE, pérdida dispersiva (peso 0,45), pérdida de doble correspondencia (peso 0,85) y pérdida de similitud.

Rendimiento

En BEIR, el modelo logra 61,94 NDCG{'@'}10, el más alto entre todos los rerankers evaluados y una mejora del 4,88 % respecto a jina-reranker-v2. Destaca en la recuperación multi-salto (78,56 en HotpotQA) y la verificación de hechos (93,95 en FEVER). El rendimiento multilingüe alcanza 66,50 en MIRACL a lo largo de 18 idiomas, con 78,69 en árabe y 81,06 en tailandés. La recuperación de código alcanza 63,28 en CoIR. Supera al mxbai-rerank-large de 1,5B (61,44) con 2,5× menos parámetros y muestra una mejora del 5,43 % frente a bge-reranker-v2-m3 de la misma escala. El rendimiento es relativamente estable a lo largo de los ordenamientos de documentos: aleatorio (62,54), descendente (61,94), ascendente (61,52), lo que indica un scoring listwise robusto independiente del orden de los candidatos.

Guía

Use la plantilla de prompt estructurada con roles de sistema/usuario/asistente y tokens especiales para la extracción de embeddings. Procese hasta 64 documentos por pasada hacia adelante para colecciones que excedan el contexto de 131K. Es óptimo con documentos ordenados aleatoriamente o por relevancia descendente (la diferencia de rendimiento es <1 %). Aproveche la capacidad de interacción entre documentos para tareas de clasificación comparativa — el diseño listwise del modelo captura relaciones entre candidatos que el scoring por pares pasa por alto. Para aplicaciones multilingües, el modelo ofrece una transferencia zero-shot sólida en 18 idiomas. Implemente procesamiento por lotes para conjuntos grandes de documentos, manteniendo los embeddings de consulta de forma consistente entre lotes. Los embeddings de salida de 256 dimensiones admiten un cálculo de similitud eficiente. Ideal para tareas de razonamiento multi-salto y verificación de hechos. Para producción, use jina-reranker-v3.5 para una inferencia 1,22–1,56× más rápida mediante atención híbrida.

Blogs que mencionan este modelo