Jina AI анонсирует новые модели в своем семействе передовых моделей для переранжирования, теперь доступные на AWS Sagemaker и Hugging Face: jina-reranker-v1-turbo-en и jina-reranker-v1-tiny-en. Эти модели отдают приоритет скорости и размеру, сохраняя при этом высокую производительность на стандартных тестах, предлагая более быстрый и эффективный с точки зрения памяти процесс переранжирования для сред, где критически важны время отклика и использование ресурсов.



Reranker Turbo и Tiny оптимизированы для молниеносного времени отклика в приложениях для поиска информации. Как и наши модели эмбеддингов, они используют архитектуру JinaBERT, вариант архитектуры BERT, улучшенный симметричным двунаправленным вариантом ALiBi. Эта архитектура обеспечивает поддержку длинных текстовых последовательностей: наши модели принимают до 8192 токенов, что идеально подходит для глубокого анализа больших документов и сложных запросов, требующих детального понимания языка.
Модели Turbo и Tiny основываются на опыте, полученном от Jina Reranker v1. Переранжирование может стать серьезным узким местом для приложений поиска информации. Традиционные поисковые приложения — это очень зрелая технология, производительность которой хорошо изучена. Переранжировщики добавляют большую точность текстовому поиску, но модели ИИ велики и могут работать медленно и дорого.
Многие пользователи предпочли бы меньшую, более быструю и дешевую модель, даже если это приведет к некоторой потере точности. Наличие единственной цели — переранжирования результатов поиска — позволяет оптимизировать модель и обеспечить пользователям конкурентоспособную производительность в гораздо более компактных моделях. Используя меньше скрытых слоев, мы ускоряем обработку и уменьшаем размер модели. Эти модели стоят меньше в эксплуатации, а большая скорость делает их более полезными для приложений, которые не могут допускать большой задержки, при этом сохраняя почти всю производительность больших моделей.
В этой статье мы покажем вам архитектуру Reranker Turbo и Reranker Tiny, измерим их производительность и покажем, как начать с ними работать.
tagОптимизированная архитектура
Jina Reranker Turbo (jina-reranker-v1-turbo-en) использует шестислойную архитектуру с общим количеством 37,8 миллионов параметров, в отличие от 137 миллионов параметров и двенадцати слоев базовой модели переранжирования jina-reranker-v1-base-en. Это представляет собой уменьшение размера модели на три четверти и увеличение скорости обработки до трех раз.
Reranker Tiny (jina-reranker-v1-tiny-en) использует четыре слоя с 33 миллионами параметров, обеспечивая еще большую параллельную обработку и более высокую скорость — почти в пять раз быстрее базовой модели Reranker — при этом экономя 13% затрат памяти по сравнению с моделью Turbo.

tagДистилляция знаний
Мы обучили Reranker Turbo и Tiny используя дистилляцию знаний. Это техника использования существующей модели ИИ для обучения другой модели соответствовать её поведению. Вместо использования внешних источников данных мы используем существующую модель для генерации данных для обучения. Мы использовали базовую модель Jina Reranker для ранжирования коллекций документов, а затем использовали эти результаты для обучения как Turbo, так и Tiny. Таким образом, мы можем привлечь гораздо больше данных в процесс обучения, поскольку мы не ограничены доступными реальными данными.
Это немного похоже на то, как ученик учится у учителя: уже обученная высокопроизводительная модель – базовая модель Jina Reranker – "обучает" необученные модели Jina Turbo и Jina Tiny, генерируя новые обучающие данные. Эта техника широко используется для создания маленьких моделей из больших. В лучшем случае разница в производительности задач между моделью-"учителем" и моделью-"учеником" может быть очень маленькой.
tagОценка на BEIR
Преимущества оптимизации и дистилляции знаний достигаются при относительно небольших затратах качества производительности. На бенчмарке BEIR для информационного поиска, jina-reranker-v1-turbo-en показывает чуть менее 95% точности jina-reranker-v1-base-en, а jina-reranker-v1-tiny-en показывает 92,5% от оценки базовой модели.
Все модели Jina Reranker конкурентоспособны с другими популярными моделями переранжирования, большинство из которых имеют гораздо большие размеры.
| Модель | Оценка BEIR (NDCC@10) | Параметры |
|---|---|---|
| Модели Jina Reranker | ||
| jina-reranker-v1-base-en | 52.45 | 137M |
| jina-reranker-v1-turbo-en | 49.60 | 38M |
| jina-reranker-v1-tiny-en | 48.54 | 33M |
| Другие модели переранжирования | ||
mxbai-rerank-base-v1 |
49.19 | 184M |
mxbai-rerank-xsmall-v1 |
48.80 | 71M |
ms-marco-MiniLM-L-6-v2 |
48.64 | 23M |
bge-reranker-base |
47.89 | 278M |
ms-marco-MiniLM-L-4-v2 |
47.81 | 19M |
NDCC@10: Оценки рассчитаны с использованием Нормализованного дисконтированного накопленного выигрыша для топ-10 результатов.

Только MiniLM-L6 (ms-marco-MiniLM-L-6-v2) и MiniLM-L4 (ms-marco-MiniLM-L-4-v2) имеют сопоставимые размеры и скорости, при этом jina-reranker-v1-turbo-en и jina-reranker-v1-tiny-en показывают сопоставимую или значительно лучшую производительность.
Мы получаем похожие результаты на тесте LlamaIndex RAG. Мы протестировали все три Jina Reranker в конфигурации RAG, используя три модели для векторного поиска (jina-embeddings-v2-base-en, bge-base-en-v1.5 и Cohere-embed-english-v3.0) и усреднили оценки.
| Reranker Model | Avg. Hit Rate | Avg. MRR |
|---|---|---|
| Jina Reranker models | ||
| jina-reranker-v1-base-en | 0.8439 | 0.7006 |
| jina-reranker-v1-turbo-en | 0.8351 | 0.6498 |
| jina-reranker-v1-tiny-en | 0.8316 | 0.6761 |
| Other reranking models | ||
mxbai-rerank-base-v1 |
0.8105 | 0.6583 |
mxbai-rerank-xsmall-v1 |
0.8193 | 0.6673 |
ms-marco-MiniLM-L-6-v2 |
0.8052 | 0.6121 |
bge-reranker-base |
0.8175 | 0.6480 |
ms-marco-MiniLM-L-4-v2 |
0.8246 | 0.6354 |
Для задач генерации с дополненным поиском (RAG) потери в качестве результатов даже меньше, чем в тесте BEIR для чистого информационного поиска. И когда производительность RAG сравнивается со скоростью обработки, мы видим, что только ms-marco-MiniLM-L-4-v2 обеспечивает значительно большую пропускную способность, но со значительными потерями в качестве результатов.

tagЭкономия затрат на AWS
Использование Reranker Turbo и Reranker Tiny обеспечивает значительную экономию для пользователей AWS и Azure, которые платят за использование памяти и время CPU. Хотя степень экономии варьируется для разных случаев использования, примерно 75% сокращение использования памяти напрямую соответствует 75% экономии для облачных систем, взимающих плату за память.
Более того, более высокая пропускная способность означает, что вы можете выполнять больше запросов на более дешевых инстансах AWS.
tagНачало работы
Модели Jina Reranker просты в использовании и интеграции в ваши приложения и рабочие процессы. Чтобы начать, вы можете посетить страницу Reranker API, чтобы узнать, как использовать наш сервис и получить 1 миллион бесплатных токенов для пробного использования.

Наши модели также доступны в AWS SageMaker. Для получения дополнительной информации смотрите наш учебник по настройке системы генерации с дополненным поиском в AWS.


Модели Jina Reranker также доступны для загрузки под лицензией Apache 2.0 с Hugging Face:








