Пресс-релиз
апрель 18, 2024

Меньше, Быстрее, Дешевле: Представляем Jina Rerankers Turbo и Tiny

Jina AI анонсирует новые модели для переранжирования: Jina Rerankers Turbo (jina-reranker-v1-turbo-en) и Tiny (jina-reranker-v1-tiny-en), которые теперь доступны на AWS Sagemaker и Hugging Face, предлагая более быстрое, эффективное по памяти и высокопроизводительное переранжирование.
Yuting Zhang, Scott Martens • 7 минуты чтения

Jina AI анонсирует новые модели в своем семействе передовых моделей для переранжирования, теперь доступные на AWS Sagemaker и Hugging Face: jina-reranker-v1-turbo-en и jina-reranker-v1-tiny-en. Эти модели отдают приоритет скорости и размеру, сохраняя при этом высокую производительность на стандартных тестах, предлагая более быстрый и эффективный с точки зрения памяти процесс переранжирования для сред, где критически важны время отклика и использование ресурсов.

AWS Marketplace: Jina AI
jinaai/jina-reranker-v1-turbo-en · Hugging Face
Мы находимся на пути к развитию и демократизации искусственного интеллекта через открытый исходный код и открытую науку.
jinaai/jina-reranker-v1-tiny-en · Hugging Face
Мы находимся на пути к развитию и демократизации искусственного интеллекта через открытый исходный код и открытую науку.

Reranker Turbo и Tiny оптимизированы для молниеносного времени отклика в приложениях для поиска информации. Как и наши модели эмбеддингов, они используют архитектуру JinaBERT, вариант архитектуры BERT, улучшенный симметричным двунаправленным вариантом ALiBi. Эта архитектура обеспечивает поддержку длинных текстовых последовательностей: наши модели принимают до 8192 токенов, что идеально подходит для глубокого анализа больших документов и сложных запросов, требующих детального понимания языка.

Модели Turbo и Tiny основываются на опыте, полученном от Jina Reranker v1. Переранжирование может стать серьезным узким местом для приложений поиска информации. Традиционные поисковые приложения — это очень зрелая технология, производительность которой хорошо изучена. Переранжировщики добавляют большую точность текстовому поиску, но модели ИИ велики и могут работать медленно и дорого.

Многие пользователи предпочли бы меньшую, более быструю и дешевую модель, даже если это приведет к некоторой потере точности. Наличие единственной цели — переранжирования результатов поиска — позволяет оптимизировать модель и обеспечить пользователям конкурентоспособную производительность в гораздо более компактных моделях. Используя меньше скрытых слоев, мы ускоряем обработку и уменьшаем размер модели. Эти модели стоят меньше в эксплуатации, а большая скорость делает их более полезными для приложений, которые не могут допускать большой задержки, при этом сохраняя почти всю производительность больших моделей.

В этой статье мы покажем вам архитектуру Reranker Turbo и Reranker Tiny, измерим их производительность и покажем, как начать с ними работать.

tagОптимизированная архитектура

Jina Reranker Turbo (jina-reranker-v1-turbo-en) использует шестислойную архитектуру с общим количеством 37,8 миллионов параметров, в отличие от 137 миллионов параметров и двенадцати слоев базовой модели переранжирования jina-reranker-v1-base-en. Это представляет собой уменьшение размера модели на три четверти и увеличение скорости обработки до трех раз.

Reranker Tiny (jina-reranker-v1-tiny-en) использует четыре слоя с 33 миллионами параметров, обеспечивая еще большую параллельную обработку и более высокую скорость — почти в пять раз быстрее базовой модели Reranker — при этом экономя 13% затрат памяти по сравнению с моделью Turbo.

График, сравнивающий производительность версий Jina Reranker с полосами, представляющими обработанные документы за 50мс.
Пропускная способность документов для моделей Jina Reranker

tagДистилляция знаний

Мы обучили Reranker Turbo и Tiny используя дистилляцию знаний. Это техника использования существующей модели ИИ для обучения другой модели соответствовать её поведению. Вместо использования внешних источников данных мы используем существующую модель для генерации данных для обучения. Мы использовали базовую модель Jina Reranker для ранжирования коллекций документов, а затем использовали эти результаты для обучения как Turbo, так и Tiny. Таким образом, мы можем привлечь гораздо больше данных в процесс обучения, поскольку мы не ограничены доступными реальными данными.

Это немного похоже на то, как ученик учится у учителя: уже обученная высокопроизводительная модель – базовая модель Jina Reranker – "обучает" необученные модели Jina Turbo и Jina Tiny, генерируя новые обучающие данные. Эта техника широко используется для создания маленьких моделей из больших. В лучшем случае разница в производительности задач между моделью-"учителем" и моделью-"учеником" может быть очень маленькой.

tagОценка на BEIR

Преимущества оптимизации и дистилляции знаний достигаются при относительно небольших затратах качества производительности. На бенчмарке BEIR для информационного поиска, jina-reranker-v1-turbo-en показывает чуть менее 95% точности jina-reranker-v1-base-en, а jina-reranker-v1-tiny-en показывает 92,5% от оценки базовой модели.

Все модели Jina Reranker конкурентоспособны с другими популярными моделями переранжирования, большинство из которых имеют гораздо большие размеры.

Модель Оценка BEIR (NDCC@10) Параметры
Модели Jina Reranker
jina-reranker-v1-base-en 52.45 137M
jina-reranker-v1-turbo-en 49.60 38M
jina-reranker-v1-tiny-en 48.54 33M
Другие модели переранжирования
mxbai-rerank-base-v1 49.19 184M
mxbai-rerank-xsmall-v1 48.80 71M
ms-marco-MiniLM-L-6-v2 48.64 23M
bge-reranker-base 47.89 278M
ms-marco-MiniLM-L-4-v2 47.81 19M

NDCC@10: Оценки рассчитаны с использованием Нормализованного дисконтированного накопленного выигрыша для топ-10 результатов.

График, показывающий оценки BEIR для различных проектов ранжирования, оценивающий производительность модели по обработанным документам за 50 мс.
Тест BEIR: Пропускная способность (ось x) vs Оценка (ось y)(Обратите внимание, что ось y не начинается с нуля. Мы начинаем с более высокого значения оценки BIER для улучшения читаемости графика.)

Только MiniLM-L6 (ms-marco-MiniLM-L-6-v2) и MiniLM-L4 (ms-marco-MiniLM-L-4-v2) имеют сопоставимые размеры и скорости, при этом jina-reranker-v1-turbo-en и jina-reranker-v1-tiny-en показывают сопоставимую или значительно лучшую производительность.

Мы получаем похожие результаты на тесте LlamaIndex RAG. Мы протестировали все три Jina Reranker в конфигурации RAG, используя три модели для векторного поиска (jina-embeddings-v2-base-en, bge-base-en-v1.5 и Cohere-embed-english-v3.0) и усреднили оценки.

Reranker Model Avg. Hit Rate Avg. MRR
Jina Reranker models
jina-reranker-v1-base-en 0.8439 0.7006
jina-reranker-v1-turbo-en 0.8351 0.6498
jina-reranker-v1-tiny-en 0.8316 0.6761
Other reranking models
mxbai-rerank-base-v1 0.8105 0.6583
mxbai-rerank-xsmall-v1 0.8193 0.6673
ms-marco-MiniLM-L-6-v2 0.8052 0.6121
bge-reranker-base 0.8175 0.6480
ms-marco-MiniLM-L-4-v2 0.8246 0.6354

MRR: Средний обратный ранг

Для задач генерации с дополненным поиском (RAG) потери в качестве результатов даже меньше, чем в тесте BEIR для чистого информационного поиска. И когда производительность RAG сравнивается со скоростью обработки, мы видим, что только ms-marco-MiniLM-L-4-v2 обеспечивает значительно большую пропускную способность, но со значительными потерями в качестве результатов.

График рассеяния, показывающий частоту попаданий относительно скорости обработки документов для языковых моделей, с выделенными моделями, такими как "jina-reranker" и "ms-m"
Тест LlamaIndex RAG: Пропускная способность (ось x) vs Частота попаданий (ось y)(Обратите внимание, что ось y не начинается с нуля. Мы начинаем с более высокого значения частоты попаданий для улучшения читаемости графика.)

tagЭкономия затрат на AWS

Использование Reranker Turbo и Reranker Tiny обеспечивает значительную экономию для пользователей AWS и Azure, которые платят за использование памяти и время CPU. Хотя степень экономии варьируется для разных случаев использования, примерно 75% сокращение использования памяти напрямую соответствует 75% экономии для облачных систем, взимающих плату за память.

Более того, более высокая пропускная способность означает, что вы можете выполнять больше запросов на более дешевых инстансах AWS.

tagНачало работы

Модели Jina Reranker просты в использовании и интеграции в ваши приложения и рабочие процессы. Чтобы начать, вы можете посетить страницу Reranker API, чтобы узнать, как использовать наш сервис и получить 1 миллион бесплатных токенов для пробного использования.

Reranker API
Максимизируйте релевантность поиска и точность RAG с легкостью

Наши модели также доступны в AWS SageMaker. Для получения дополнительной информации смотрите наш учебник по настройке системы генерации с дополненным поиском в AWS.

AWS Marketplace: Jina AI
Облачный ИИ нового уровня: Jina Embeddings и Rerankers на Amazon SageMaker
Узнайте, как использовать модели Jina Embeddings и Reranking в полноценном ИИ-приложении на AWS, используя только компоненты, доступные в Amazon SageMaker и AWS Marketplace.

Модели Jina Reranker также доступны для загрузки под лицензией Apache 2.0 с Hugging Face:

jinaai/jina-reranker-v1-turbo-en · Hugging Face
Мы находимся на пути к развитию и демократизации искусственного интеллекта через открытый исходный код и открытую науку.
jinaai/jina-reranker-v1-tiny-en · Hugging Face
Мы находимся на пути к развитию и демократизации искусственного интеллекта через открытый исходный код и открытую науку.
Категории:
Пресс-релиз

Читать далее
сентябрь 14, 2026 • 9 минуты чтения
jina-ocr-v1: более быстрый разбор документов на недорогих GPU
август 03, 2026 • 11 минуты чтения
jina-reranker-v3.5: Более быстрая попарная переранжировка (listwise reranking) с использованием гибридного внимания (hybrid attention) и самодистилляции
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Векторные модели для текста, изображений, аудио и видео