Descripción general
jina-reranker-v1-tiny-en es un reranker cross-encoder en inglés de 33M parámetros — el más pequeño de la familia v1 de Jina. Mediante destilación de conocimiento agresiva, retiene el 92,5 % de la precisión del modelo base mientras procesa documentos cinco veces más rápido y usando 13 % menos memoria que la variante turbo. Está diseñado para edge computing, aplicaciones móviles y sistemas de búsqueda de alto rendimiento con presupuestos de latencia estrictos.
Métodos
El modelo emplea una arquitectura de cuatro capas optimizada basada en JinaBERT con codificaciones posicionales ALiBi bidireccionales simétricas. Su desarrollo aprovecha la destilación de conocimiento desde jina-reranker-v1-base-en de 137M parámetros, que sirve como modelo maestro. El modelo estudiante aprende comportamientos de ranking óptimos sin requerir datos de entrenamiento del mundo real extensos, igualando las distribuciones de ranking suaves del maestro mientras usa solo 33M parámetros. El diseño de cuatro capas y las dimensiones ocultas reducidas habilitan la aceleración de 5× respecto al modelo base. El modelo soporta contexto de 1.024 tokens con segmentación automática para documentos más largos.
Rendimiento
En BEIR, el modelo logra un NDCG@10 de 48,54, conservando el 92,5 % del rendimiento del modelo base (52,45) mientras es solo una cuarta parte de su tamaño. En los benchmarks de RAG de LlamaIndex, mantiene una tasa de acierto del 83,16 %, casi igualando a modelos más grandes mientras procesa documentos significativamente más rápido. El throughput es casi cinco veces más rápido que el modelo base, con 13 % menos uso de memoria que la variante turbo. Estas métricas rivalizan o exceden a modelos mucho más grandes como mxbai-rerank-base-v1 (184M) y bge-reranker-base (278M). El equilibrio rendimiento-tamaño lo hace especialmente adecuado para despliegues con recursos limitados.
Guía
Prioriza escenarios donde la velocidad de procesamiento y la eficiencia de recursos son críticas: edge computing, aplicaciones móviles y sistemas de búsqueda de alto rendimiento con presupuestos de latencia estrictos. Para aplicaciones que requieren precisión de ranking máxima absoluta, el modelo base o jina-reranker-v3.5 es preferible. El modelo requiere una GPU con soporte CUDA para el rendimiento óptimo, pero funciona en hardware menos potente que sus homólogos más grandes. Se integra con bases de datos vectoriales y frameworks RAG principales y está disponible a través de la API de Reranker de Jina y AWS SageMaker. El modelo es solo inglés; para aplicaciones multilingües, use jina-reranker-v2-base-multilingual o jina-reranker-v3.5. Al hacer fine-tuning para dominios específicos, equilibra cuidadosamente la calidad de los datos de entrenamiento con la arquitectura compacta del modelo para mantener las características de rendimiento.





