Gráfico de E/S

múltiple

Documento

Consulta

jina-reranker-v1

Ranking

Frontera de Pareto
30M100M300M0.810.820.830.84bge-reranker-basejina-reranker-v1-base-enjina-reranker-v1-tiny-enms-marco-MiniLM-L-4-v2ms-marco-MiniLM-L-6-v2mxbai-rerank-base-v1mxbai-rerank-xsmall-v1jina-reranker-v1-turbo-…Parámetros (log)hit-rate
Este modelo
En la frontera
Jina AI
Otros
LlamaIndex RAG · avg3emb
0.835
Parámetros
38M
Rango por score
2 / 8
Frontera de Pareto
En ella
Distribución de valores
AUC 0.8287
Corpus
Pares de traducción
0.4800.000.200.400.600.80
Relacionados29.0%
Negativo difícil7.0%
No relacionados1.1%
Umbrales recomendados
FPR 0.1 · 0.223
FPR 0.01 · 0.480
FPR 0.001 · 0.753
FPR 0.0001 · 0.959
equilibrado · 0.083
AUC
0.8287
Techo de ruido
0.731
Caída de exhaustividad
0.019
Pares medidos
100 / 9200
Puntuación por posición
12345678910
Puntuación media en cada posición
Elija modelos para comparar

Descripción general

jina-reranker-v1-turbo-en es un reranker cross-encoder en inglés de 37,8M parámetros que entrega el 95 % de la precisión del modelo base mientras procesa documentos tres veces más rápido y usando 75 % menos memoria. Fue diseñado para sistemas de búsqueda de producción donde el equilibrio calidad-latencia de los cross-encoders completos era impráctico, ofreciendo una vía práctica para el refinamiento de la búsqueda a escala.

Métodos

El modelo comprime la arquitectura BERT de 12 capas del reranker base en un diseño de seis capas con 37,8M parámetros (frente a 137M para base). Mantiene el mecanismo central de cross-atención basado en BERT para interacciones a nivel de token entre consulta y documento, pero optimiza la velocidad mediante la reducción del número de capas y una asignación eficiente de parámetros. El entrenamiento usa destilación de conocimiento: el modelo base más grande actúa como maestro, guiando a la variante turbo para igualar su comportamiento de ranking con menos parámetros. El modelo soporta secuencias de hasta 8.192 tokens mediante codificaciones posicionales ALiBi, permitiendo el análisis exhaustivo de documentos manteniendo inferencias rápidas.

Rendimiento

En BEIR, la variante turbo logra un NDCG{'@'}10 de 49,60, conservando el 95 % del rendimiento del modelo base (52,45) mientras supera a bge-reranker-base (47,89, 278M parámetros). En aplicaciones RAG, mantiene una tasa de acierto del 83,51 % y 0,6498 MRR. La ventaja de velocidad es sustancial: tres veces más rápido que el modelo base, con throughput que escala casi linealmente con la reducción del número de parámetros. Los requisitos de memoria bajan de 550MB (base) a 150MB (turbo), habilitando despliegues en instancias más pequeñas y ahorros de costos significativos en entornos de nube. La degradación de rendimiento es mínima en la mayoría de tareas, con puntuaciones ligeramente más bajas en escenarios de ranking extremadamente matizados.

Guía

Implementa una pipeline de dos etapas: la búsqueda vectorial proporciona candidatos iniciales y luego este modelo vuelve a clasificar los mejores 100–200. El punto óptimo para la mayoría de aplicaciones es reclasificar 100–200 candidatos por consulta, equilibrando calidad y velocidad. El modelo es solo inglés; para aplicaciones multilingües, use jina-reranker-v2-base-multilingual o jina-reranker-v3.5. Requiere hardware con soporte CUDA, pero funciona en instancias más pequeñas que el modelo base (150MB frente a 550MB de memoria GPU). Disponible a través de Jina Reranker API y AWS SageMaker. Para nuevos proyectos, jina-reranker-v3.5 (multilingüe, listwise, contexto de 131K) es la opción recomendada. Cuando la latencia es la restricción principal, la ventaja de velocidad 3× de este modelo lo hace adecuado para aplicaciones de búsqueda en tiempo real.

Blogs que mencionan este modelo