Обзор
jina-reranker-v1-turbo-en — англоязычный cross-encoder-реранкер на 37,8M параметров, дающий 95 % точности базовой модели при обработке документов в три раза быстрее и с использованием на 75 % меньше памяти. Он был разработан для продакшн-систем поиска, где компромисс качества и латентности полных cross-encoders был непрактичным, предлагая практичный путь к улучшению поиска в масштабе.
Методы
Модель сжимает 12-слойную BERT-архитектуру базового реранкера в шестислойный дизайн на 37,8M параметров (против 137M у базы). Она сохраняет ключевой механизм BERT-cross-attention для token-взаимодействий между запросом и документом, но оптимизирует скорость за счёт уменьшения числа слоёв и эффективного распределения параметров. Обучение использует дистилляцию знаний: более крупная базовая модель выступает учителем, направляя turbo-вариант совпадать со своим поведением ранжирования при меньшем числе параметров. Модель поддерживает последовательности до 8 192 токенов благодаря ALiBi позиционному кодированию, обеспечивая комплексный анализ документов при сохранении быстрого вывода.
Производительность
На BEIR turbo-вариант достигает NDCG@10 49,60, сохраняя 95 % производительности базовой модели (52,45), при этом превосходя bge-reranker-base (47,89, 278M параметров). В RAG-приложениях она поддерживает hit rate 83,51 % и MRR 0,6498. Скоростное преимущество существенно: в три раза быстрее базовой модели, с пропускной способностью, масштабирующейся почти линейно с уменьшением числа параметров. Требования к памяти снижаются с 550MB (база) до 150MB (turbo), что позволяет развёртывать на меньших инстансах и значительно экономить в облачных средах. Деградация производительности минимальна на большинстве задач, с несколько более низкими оценками в сценариях ранжирования с крайне тонкими различиями.
Руководство
Реализуйте двухэтапный конвейер: векторный поиск даёт начальные кандидаты, затем эта модель пере-ранжирует топ 100–200. Оптимум для большинства приложений — пере-ранжирование 100–200 кандидатов на запрос, балансируя качество и скорость. Модель только на английском — для мультиязычных приложений используйте jina-reranker-v2-base-multilingual или jina-reranker-v3.5. Требуется CUDA-аппаратура, но она работает на меньших инстансах, чем базовая модель (150MB против 550MB GPU-памяти). Доступна через Jina Reranker API и AWS SageMaker. Для новых проектов рекомендуется jina-reranker-v3.5 (мультиязычная, listwise, контекст 131K). Когда латентность — главный ограничитель, 3× преимущество скорости этой модели делает её подходящей для приложений поиска в реальном времени.





