Descripción general
jina-reranker-v1-turbo-en es un reranker cross-encoder en inglés de 37,8M parámetros que entrega el 95 % de la precisión del modelo base mientras procesa documentos tres veces más rápido y usando 75 % menos memoria. Fue diseñado para sistemas de búsqueda de producción donde el equilibrio calidad-latencia de los cross-encoders completos era impráctico, ofreciendo una vía práctica para el refinamiento de la búsqueda a escala.
Métodos
El modelo comprime la arquitectura BERT de 12 capas del reranker base en un diseño de seis capas con 37,8M parámetros (frente a 137M para base). Mantiene el mecanismo central de cross-atención basado en BERT para interacciones a nivel de token entre consulta y documento, pero optimiza la velocidad mediante la reducción del número de capas y una asignación eficiente de parámetros. El entrenamiento usa destilación de conocimiento: el modelo base más grande actúa como maestro, guiando a la variante turbo para igualar su comportamiento de ranking con menos parámetros. El modelo soporta secuencias de hasta 8.192 tokens mediante codificaciones posicionales ALiBi, permitiendo el análisis exhaustivo de documentos manteniendo inferencias rápidas.
Rendimiento
En BEIR, la variante turbo logra un NDCG@10 de 49,60, conservando el 95 % del rendimiento del modelo base (52,45) mientras supera a bge-reranker-base (47,89, 278M parámetros). En aplicaciones RAG, mantiene una tasa de acierto del 83,51 % y 0,6498 MRR. La ventaja de velocidad es sustancial: tres veces más rápido que el modelo base, con throughput que escala casi linealmente con la reducción del número de parámetros. Los requisitos de memoria bajan de 550MB (base) a 150MB (turbo), habilitando despliegues en instancias más pequeñas y ahorros de costos significativos en entornos de nube. La degradación de rendimiento es mínima en la mayoría de tareas, con puntuaciones ligeramente más bajas en escenarios de ranking extremadamente matizados.
Guía
Implementa una pipeline de dos etapas: la búsqueda vectorial proporciona candidatos iniciales y luego este modelo vuelve a clasificar los mejores 100–200. El punto óptimo para la mayoría de aplicaciones es reclasificar 100–200 candidatos por consulta, equilibrando calidad y velocidad. El modelo es solo inglés; para aplicaciones multilingües, use jina-reranker-v2-base-multilingual o jina-reranker-v3.5. Requiere hardware con soporte CUDA, pero funciona en instancias más pequeñas que el modelo base (150MB frente a 550MB de memoria GPU). Disponible a través de Jina Reranker API y AWS SageMaker. Para nuevos proyectos, jina-reranker-v3.5 (multilingüe, listwise, contexto de 131K) es la opción recomendada. Cuando la latencia es la restricción principal, la ventaja de velocidad 3× de este modelo lo hace adecuado para aplicaciones de búsqueda en tiempo real.





