

Сегодня мы выпускаем jina-reranker-v3.5 — списочный重排器 с 0,6 млрд параметров, который сохраняет механизм взаимодействия last but not late (последний, но не поздний) из jina-reranker-v3, делая его быстрее и значительно эффективнее при работе с данными, которые действительно ищут предприятия. Он достигает 63,20 nDCG@10 на BEIR, опережая Qwen3-Reranker-4B при примерно в 7 раз меньшем количестве параметров, и выполняет переранжирование до 1,56 раза быстрее, чем v3, на длинных документах. Самый большой скачок наблюдается в полуструктурированном поиске: +9,6 nDCG@10 по сравнению с v3 на записях с ограничениями по полям.
Этого удалось достичь благодаря трем изменениям. Гибридное расписание внимания, которое заменяет большинство глобальных слоев на скользящие окна, при этом фиксируя последний слой как глобальный. Обучающая выборка, составленная из типичных ошибок в юридическом, медицинском, финансовом, многоязычном и структурированном поиске. И трехэтапный рецепт самодистилляции, где учитель и ученик имеют одинаковый размер и различаются только структурой внимания.
Качество в зависимости от количества параметров в четырех бенчмарк-режимах. jina-reranker-v3.5 находится на границе Парето во всех четырех: ни одна модель, которую мы оценивали, не является одновременно меньше и лучше.

mxbai-rerank-large-v2 с 62,45 и 4B Qwen3-Reranker-4B с 62,28. Ни одна более крупная модель, которую мы оценивали, не дает прироста качества BEIR по сравнению с ней.
Qwen3-Reranker-4B удерживает угол 4B с 76,56. Наибольший прирост по языкам по сравнению с jina-reranker-v3 наблюдается для йоруба (+4,4), фарси (+3,1) и французского (+3,0).
Qwen3-Reranker-0.6B (68,41), так и 1,5B mxbai-rerank-large-v2 (70,81), работая при этом на 0,6 млрд параметров. Оставшаяся разница до Qwen3-Reranker-4B (77,68) концентрируется в нескольких юридических и медицинских задачах.
tagАрхитектура
Списочное переранжирование оценивает каждого кандидата за один прямой проход, поэтому полное self-attention над списком из 100 документов растет квадратично и раздувает KV-кэш. Очевидным решением является внимание со скользящим окном. При взаимодействии LBNL очевидное решение ломает модель.
В LBNL запрос и все кандидаты образуют одну причинно-следственную последовательность, а 词元 (токен) эмбеддинга запроса находится в самом конце. Он должен проследить связь до первого кандидата, чтобы построить представление, учитывающее междокументные связи. Конечное окно разрывает эту зависимость. Поэтому мы всегда фиксируем последний слой как глобальный, чтобы 词元 (токены) эмбеддинга запроса и документа наблюдали весь контекст кандидатов в момент извлечения. Замена этого одного слоя на скользящее окно сильно ухудшает списочное ранжирование; сохранение только его в глобальном виде поддерживает совместное кодирование без полностью глобального стека.
Для оставшихся 27 слоев мы протестировали расписания 1L1G, 1L2G, 3L2G и 5L1G. Победило 3L2G: три слоя со скользящим окном, за которыми следуют два глобальных слоя, повторяющиеся 17 локальных и 11 глобальных слоев с окном в 1024 词元 (токена). Локальные слои снижают стоимость внимания с O(L²) до O(L·w), в то время как глобальные слои на каждом третьем шаге обновляют сигнал между кандидатами на дальних дистанциях на каждой глубине. Более плотные расписания не дали прироста пропускной способности; более агрессивный подход 5L1G показал худшие результаты в сложных задачах с множеством документов.

tagСамодистилляция через разрыв внимания
Дистилляция здесь необычна. Мы не сжимаем большое大大大大模型 в 小模型. Учитель и ученик имеют одинаковый размер 0,6 млрд параметров и различаются только паттерном внимания. Учитель использует полное внимание (full attention) с квадратичными затратами; ученик использует архитектуру 3L2G.
Принуждение ученика одновременно переключать маски внимания и соответствовать выводам учителя приводит к провалу по обоим пунктам, поэтому рецепт разделяет эти два воздействия:
- Этап I — учитель с полным вниманием. Начиная с публичного чекпоинта jina-reranker-v3, мы проводим полную дообучение учителя без ограничений скользящего окна на всей смеси данных v3.5. Это устанавливает потолок качества для данного бюджета параметров.
- Этап II — адаптация разреженного внимания. Ученик инициализируется весами Этапа I и активирует 3L2G. Сначала мы обучаем только проекции внимания, замораживая все остальное, обучая разреженные маски передавать информацию, не нарушая представлений, изученных при полном внимании. Затем мы размораживаем все параметры, чтобы ученик подстроился под новую геометрию внимания. Ученик уже готов к развертыванию и работает быстрее, но на бенчмарках BEIR, RTEB-legal и MIRACL все еще сохраняется устойчивый разрыв по сравнению с учителем.
- Этап III — дистилляция под руководством учителя. При замороженном учителе мы выравниваем ученика сразу по четырем уровням: списковое (listwise) KL-расхождение по нормализованным softmax распределениям оценок, MSE по абсолютным оценкам, MSE по скрытым состояниям последнего слоя и косинусная потеря на спроецированных 向量模型, плюс регуляризаторы контекстного сходства и дисперсии.
Порядок имеет значение. Второй этап сам по себе оставляет заметный разрыв, поскольку ученик должен изменить свою маршрутизацию под более слабой маской, прежде чем сможет безопасно имитировать оценки и состояния учителя. Третий этап затем устраняет большую часть этого разрыва, что говорит о том, что способность полного внимания передается разреженному ученику, как только геометрия адаптировалась. Рецепт написан для 3L2G, но схема обобщается и на другие несоответствия расписания внимания.
tagДанные для обучения
Смесь v3 хорошо покрывала общий поиск, но плохо справлялась со специализированными доменами. Вместо добавления большего объема данных мы провели анализ ошибок на наборах разработки RTEB и STARK и создали каждый новый сегмент данных так, чтобы он покрывал именно те паттерны поиска, с которыми не справляются общие модели. «Трудные» отрицательные примеры (hard negatives) поступают от нескольких поисковых систем одновременно (BM25, Jina, BGE, GTE, E5, ColBERT), поэтому модель не может выучить «короткие пути» какой-то одной системы.
Юридический сегмент объединяет мультиязычные данные EUR-Lex, CLERC, AILA, канадское прецедентное право, швейцарские резюме дел и EuroVoc; они перевыбраны, так как юридические тексты плотно насыщены цитатами и объемны. Медицинский сегмент нацелен на клиническую терминологию и насыщенные сущностями отрывки. Финансовый сегмент отдает приоритет числовым утверждениям, регуляторному языку и текстам с таблицами. Мультиязычное покрытие расширено за пределы MIRACL и mMARCO за счет WebFAQ на 50+ языках, межъязыковых отрицательных примеров SWIM-IR и японских пар Ruri-v3.
Структурированные данные получили наибольший вес при выборке, так как они находятся вне распределения обычного текста, которое предполагают стандартные бенчмарки. Релевантность записей и таблиц зависит от равенства, числовых и временных границ, вхождения в списки и логических комбинаций по полям, а не от лексического перекрытия. Ранние запуски показывали здесь худшие результаты, поэтому мы синтезировали пары с жесткими ограничениями напрямую.

tagРезультаты экспериментов
Все числа получены путем переранжирования топ-100 кандидатов от jina-embeddings-v5-text-small в рамках единого конвейера MTEB v2, поэтому они могут немного отличаться от данных, заявленных поставщиками. Полные таблицы по каждому набору данных и языку приведены в статье.
| Модель | Параметры | BEIR | MIRACL | RTEB | Struct-IR |
|---|---|---|---|---|---|
| jina-embeddings-v5-text-small (1-й этап) | 0.5 млрд | 56.26 | 65.15 | 64.60 | – |
| mxbai-rerank-base-v2 | 0.5 млрд | 59.58 | 64.90 | 61.44 | 30.4 |
| Qwen3-Reranker-0.6B | 0.6 млрд | 56.94 | 67.12 | 68.41 | 41.9 |
| mxbai-rerank-large-v2 | 1.5 млрд | 62.45 | 69.65 | 70.81 | 43.0 |
| Qwen3-Reranker-4B | 4.0 млрд | 62.28 | 76.56 | 77.68 | 55.6 |
| jina-reranker-v3 | 0.6 млрд | 62.10 | 72.20 | 68.01 | 38.7 |
| <strong>jina-reranker-v3.5</strong> | 0.6 млрд | 63.20 | 74.11 | 70.95 | 48.3 |
Модель v3.5 превосходит v3 по всем семействам бенчмарков при том же количестве параметров, с наибольшим приростом в полуструктурированном поиске.
Прирост в RTEB сосредоточен там, где была нацелена смесь: AILA-Statute улучшился на 14.0 пунктов, AILA-Case — на 11.7 по сравнению с v3, а FinQA достигает 86.91, что является лучшим результатом среди всех протестированных моделей. На STARK v3.5 превосходит v3 по всем трем официальным метрикам и занимает первое место по Hit@5 в целом.
Примечание по протоколу Struct-IR. Бенчмарк индексирует миллионы объектов на схему, и Recall@5 первого этапа внутри схемы составляет около 0.04, поэтому сквозной процесс поиска и переранжирования почти полностью ограничен качеством первого этапа и плохо дифференцирует 重排器. Вместо этого мы вводим все эталонные документы вместе с 30 самыми сложными дистракторами первого этапа, что изолирует дискриминацию с ограничениями по полям от охвата поиска. Числа, полученные при таком подходе, несопоставимы с таблицей лидеров SSRB.
tagЭффективность
Измерено на одном NVIDIA A100, размер пакета 1, входные данные топ-100 спискового поиска, FlashAttention-2.


Поскольку в промышленном списковом переранжировании доминирует одиночный префилл по набору свежих кандидатов, эти сокращения напрямую транслируются в возможность обработки более длинных списков кандидатов и более крупных документов при фиксированном бюджете ресурсов.
tagНачало работы
tagЧерез Jina Search Foundation API
curl -X POST \
https://api.jina.ai/v1/rerank \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ***" \
-d '{
"model": "jina-reranker-v3.5",
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"documents": [
"...",
"..."
],
"return_documents": false
}'tagЧерез Elastic Inference Service
Модель jina-reranker-v3.5 доступна в Elastic Inference Service (EIS) начиная со стека 9.3, поэтому вы можете выполнять переранжирование на управляемых GPU без хостинга модели собственными силами. Создайте эндпоинт вывода (inference endpoint), ссылающийся на модель, а затем вызывайте его, как любую другую задачу rerank.
PUT _inference/rerank/eis-jina-reranker-v3-5
{
"service": "elastic",
"service_settings": {
"model_id": "jina-reranker-v3.5"
}
}POST _inference/rerank/eis-jina-reranker-v3-5
{
"query": "trail-running shoes under $150, rated 4.5+, released since 2022",
"input": [
"...",
"..."
]
}Ответ возвращает массив rerank, упорядоченный по релевантности, где каждая запись содержит исходный индекс кандидата и его оценку. Поскольку это стандартный эндпоинт вывода, на inference_id можно ссылаться напрямую из поискового запроса в объекте text_similarity_reranker.
tagЧерез transformers
from transformers import AutoModel
model = AutoModel.from_pretrained(
'jinaai/jina-reranker-v3.5',
dtype="auto",
trust_remote_code=True,
)
model.eval()
query = "What are the health benefits of green tea?"
documents = [
"Green tea contains catechins that may help reduce inflammation.",
"El precio del cafe ha aumentado un 20% este ano.",
"绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
"Le the vert est riche en antioxydants.",
]
for r in model.rerank(query, documents):
print(f"{r['relevance_score']:.4f} {r['document'][:70]}")tagЗаключение
Практическое преимущество jina-reranker-v3.5 является узкоспециализированным и поддается проверке: при 0,6 млрд параметров целенаправленное обучение сокращает большую часть разрыва с 4-миллиардным универсальным重排器 (reranker), а в бенчмарке BEIR этот разрыв устраняется полностью, при этом модель работает быстрее, чем та, которую она заменяет. Для корпоративного поиска это аргумент в пользу инвестирования в сфокусированное обучение на компактной базе, а не в использование самой большой доступной модели.
Стоит прямо обозначить два ограничения. Списочные (listwise)重排器 (reranker) по-прежнему имеют ограничения по входным данным, которых избегают поточечные (pointwise) модели и модели с поздним взаимодействием (late-interaction), в частности, фиксированные верхние границы по количеству кандидатов и их общей длине. Кроме того, остаются заметные отставания от модели Qwen на 4 млрд параметров в юридических и медицинских задачах RTEB, в структурированном поиске (Struct-IR) с контролируемым пулом, а также в языках с ограниченными ресурсами в рамках MIRACL. Это сложные случаи, и мы называем их открыто, а не скрываем за средними показателями.






