Обзор
jina-reranker-v1-tiny-en — англоязычный cross-encoder-реранкер на 33M параметров — самый маленький в семействе v1 Jina. Благодаря агрессивной дистилляции знаний он сохраняет 92,5 % точности базовой модели, обрабатывая документы в пять раз быстрее и используя на 13 % меньше памяти, чем turbo-вариант. Он предназначен для edge-вычислений, мобильных приложений и высокопроизводительных систем поиска со строгими бюджетами латентности.
Методы
Модель использует упрощённую четырёхслойную архитектуру на базе JinaBERT с симметричным двунаправленным ALiBi позиционным кодированием. Её разработка использует дистилляцию знаний из 137M-параметровой модели jina-reranker-v1-base-en, которая служит моделью-учителем. Модель-ученик осваивает оптимальные ранжировочные поведения без обширных данных реального обучения, совпадая с мягкими распределениями ранжирования учителя при использовании лишь 33M параметров. Четырёхслойный дизайн и уменьшенные скрытые измерения обеспечивают 5× ускорение относительно базовой модели. Модель поддерживает контекст в 1 024 токена с автоматическим чанкингом для более длинных документов.
Производительность
На BEIR модель достигает NDCG@10 48,54, сохраняя 92,5 % производительности базовой модели (52,45), будучи при этом всего четвертью её размера. На RAG-бенчмарках LlamaIndex она поддерживает hit rate 83,16 %, почти догоняя большие модели при значительно более быстрой обработке документов. Пропускная способность почти в пять раз выше базовой модели, с использованием на 13 % меньше памяти, чем turbo-вариант. Эти метрики сравнимы с намного более крупными моделями или превосходят их, например mxbai-rerank-base-v1 (184M) и bge-reranker-base (278M). Компромисс производительности и размера делает её особенно подходящей для развёртываний с ограниченными ресурсами.
Руководство
Приоритизируйте сценарии, где скорость обработки и эффективность ресурсов критичны: edge-вычисления, мобильные приложения и высокопроизводительные системы поиска со строгими бюджетами латентности. Для приложений, требующих абсолютной максимальной точности ранжирования, предпочтительнее базовая модель или jina-reranker-v3.5. Модель требует GPU с поддержкой CUDA для оптимальной производительности, но работает на менее мощном оборудовании, чем более крупные аналоги. Она интегрируется с основными векторными базами данных и RAG-фреймворками и доступна через Jina Reranker API и AWS SageMaker. Модель только на английском; для мультиязычных приложений используйте jina-reranker-v2-base-multilingual или jina-reranker-v3.5. При дообучке для определённых доменов осторожно балансируйте качество обучающих данных и компактную архитектуру модели, чтобы сохранить характеристики производительности.





