Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Архитектура
Результаты экспериментов
Начало работы
Заключение
star
Избранное
пресс-релиз
август 03, 2026

jina-reranker-v3.5: Более быстрая попарная переранжировка (listwise reranking) с использованием гибридного внимания (hybrid attention) и самодистилляции

Listwise-переранкер (重排器) размером 0,6 млрд параметров, который превосходит Qwen3-Reranker-4B в бенчмарке BEIR, работает до 1,56 раза быстрее, чем v3, и обеспечивает прирост 9,6 nDCG@10 в задачах полуструктурированного поиска.
Jina AI
Jina AI • 11 минуты чтения
jinaai/jina-reranker-v3.5 · Hugging Face
Мы на пути к развитию и демократизации искусственного интеллекта посредством открытого исходного кода и открытой науки.
jina-reranker-v3.5: Эффективный списочный重排器 с гибридным вниманием и самодистилляцией
Списочные重排器 являются дискриминационным ядром агентных конвейеров поиска, однако промышленное развертывание требует одновременной эффективности, доменной устойчивости и беглости при работе с полуструктурированными данными. Мы представляем jina-reranker-v3.5, списочный重排器 с 0,6 млрд параметров, который отвечает этим требованиям, не жертвуя сравнением между документами, которое делало его предшественник jina-reranker-v3 эффективным. jina-reranker-v3.5 сохраняет механизм взаимодействия «последний, но не поздний» (LBNL) из jina-reranker-v3 и перерабатывает его по трем осям. Он заменяет равномерное глобальное внимание на гибридное расписание из трех слоев со скользящим окном, за которыми следуют два глобальных слоя, фиксируя последний слой как глобальный, так как того требует считывание LBNL. Модель обучалась на курируемой мультидоменной выборке, охватывающей юридический, медицинский, финансовый, многоязычный и структурированный поиск. Она переносит качество через трехэтапный рецепт самодистилляции, в котором учитель с полным вниманием задает верхнюю границу, которую затем восстанавливает ученик с разреженным вниманием в рамках поэтапного протокола адаптации. jina-reranker-v3.5 достигает 63,20 nDCG@10 на BEIR, сравниваясь с моделью 4B при примерно 7-кратном уменьшении количества параметров, а также улучшает показатели jina-reranker-v3 на MIRACL и RTEB. Наибольший прирост наблюдается в полуструктурированном поиске, где он повышает nDCG@10 на 9,6 пункта по сравнению с jina-reranker-v3 и лидирует среди всех重排器 аналогичного размера. Гибридное расписание дополнительно сокращает задержку списочного вывода до 1,56 раза. Мы выпускаем веса модели на Hugging Face по некоммерческой лицензии.
arXiv.orgChristina Nasika

Сегодня мы выпускаем jina-reranker-v3.5 — списочный重排器 с 0,6 млрд параметров, который сохраняет механизм взаимодействия last but not late (последний, но не поздний) из jina-reranker-v3, делая его быстрее и значительно эффективнее при работе с данными, которые действительно ищут предприятия. Он достигает 63,20 nDCG@10 на BEIR, опережая Qwen3-Reranker-4B при примерно в 7 раз меньшем количестве параметров, и выполняет переранжирование до 1,56 раза быстрее, чем v3, на длинных документах. Самый большой скачок наблюдается в полуструктурированном поиске: +9,6 nDCG@10 по сравнению с v3 на записях с ограничениями по полям.

Этого удалось достичь благодаря трем изменениям. Гибридное расписание внимания, которое заменяет большинство глобальных слоев на скользящие окна, при этом фиксируя последний слой как глобальный. Обучающая выборка, составленная из типичных ошибок в юридическом, медицинском, финансовом, многоязычном и структурированном поиске. И трехэтапный рецепт самодистилляции, где учитель и ученик имеют одинаковый размер и различаются только структурой внимания.

Качество в зависимости от количества параметров в четырех бенчмарк-режимах. jina-reranker-v3.5 находится на границе Парето во всех четырех: ни одна модель, которую мы оценивали, не является одновременно меньше и лучше.

Scatter plot of nDCG@10 against parameter count on BEIR with a Pareto frontier line
Англоязычный zero-shot поиск на BEIR по 13 наборам данных, измеренный по nDCG@10 после переранжирования топ-100 кандидатов от jina-embeddings-v5-text-small. Красная линия отслеживает границу Парето, а заштрихованная область является доминируемой: для каждой модели внутри нее существует другая модель, которая меньше, лучше или и то, и другое. jina-reranker-v3.5 определяет границу на отметке 63,20, выше, чем 1,5B mxbai-rerank-large-v2 с 62,45 и 4B Qwen3-Reranker-4B с 62,28. Ни одна более крупная модель, которую мы оценивали, не дает прироста качества BEIR по сравнению с ней.
Scatter plot of nDCG@10 against parameter count on MIRACL with a Pareto frontier line
Многоязычный поиск на MIRACL по 18 языкам, тот же протокол переранжирования топ-100. jina-reranker-v3.5 удерживает угол 0,6 млрд параметров на границе с 74,11 (лучший результат среди всех компактных моделей), в то время как Qwen3-Reranker-4B удерживает угол 4B с 76,56. Наибольший прирост по языкам по сравнению с jina-reranker-v3 наблюдается для йоруба (+4,4), фарси (+3,1) и французского (+3,0).
Scatter plot of nDCG@10 against parameter count on RTEB with a Pareto frontier line
Поиск в профессиональных доменах на RTEB, охватывающий юридические, финансовые, программные и медицинские корпуса. jina-reranker-v3.5 достигает 70,95, обходя как модель того же размера Qwen3-Reranker-0.6B (68,41), так и 1,5B mxbai-rerank-large-v2 (70,81), работая при этом на 0,6 млрд параметров. Оставшаяся разница до Qwen3-Reranker-4B (77,68) концентрируется в нескольких юридических и медицинских задачах.
Scatter plot of nDCG@10 against parameter count on Struct-IR with a Pareto frontier line
Полуструктурированный поиск на Struct-IR в контролируемом пуле кандидатов, где все «золотые» документы встроены вместе с 30 самыми сложными дистракторами первого этапа, чтобы измерение изолировало дискриминацию с ограничениями по полям от полноты поиска. jina-reranker-v3.5 достигает 48,3, что является приростом на 9,6 пункта по сравнению с jina-reranker-v3 и самым большим отдельным улучшением в этом релизе. Обратите внимание, что этот протокол не сравним с таблицей лидеров поиска SSRB.

tagАрхитектура

Списочное переранжирование оценивает каждого кандидата за один прямой проход, поэтому полное self-attention над списком из 100 документов растет квадратично и раздувает KV-кэш. Очевидным решением является внимание со скользящим окном. При взаимодействии LBNL очевидное решение ломает модель.

В LBNL запрос и все кандидаты образуют одну причинно-следственную последовательность, а 词元 (токен) эмбеддинга запроса находится в самом конце. Он должен проследить связь до первого кандидата, чтобы построить представление, учитывающее междокументные связи. Конечное окно разрывает эту зависимость. Поэтому мы всегда фиксируем последний слой как глобальный, чтобы 词元 (токены) эмбеддинга запроса и документа наблюдали весь контекст кандидатов в момент извлечения. Замена этого одного слоя на скользящее окно сильно ухудшает списочное ранжирование; сохранение только его в глобальном виде поддерживает совместное кодирование без полностью глобального стека.

Для оставшихся 27 слоев мы протестировали расписания 1L1G, 1L2G, 3L2G и 5L1G. Победило 3L2G: три слоя со скользящим окном, за которыми следуют два глобальных слоя, повторяющиеся 17 локальных и 11 глобальных слоев с окном в 1024 词元 (токена). Локальные слои снижают стоимость внимания с O(L²) до O(L·w), в то время как глобальные слои на каждом третьем шаге обновляют сигнал между кандидатами на дальних дистанциях на каждой глубине. Более плотные расписания не дали прироста пропускной способности; более агрессивный подход 5L1G показал худшие результаты в сложных задачах с множеством документов.

Схема архитектуры, показывающая LBNL-кодирование со списковым (listwise) подходом с гибридной основой 3L2G и трехэтапным конвейером самодистилляции
Слева: LBNL-кодирование со списковым подходом на гибридной основе 3L2G Qwen3-0.6B. Запрос и все кандидаты используют общий причинно-следственный контекст; слои L используют скользящее окно размером 1024 токена, слои G являются глобальными, а терминальный слой G* жестко закреплен как глобальный, чтобы векторное представление (embeddings) итогового запроса «видело» весь список. MLP проецирует данные в общее пространство, а косинусное сходство формирует ранжирование. Справа: трехэтапный рецепт, где учитель с полным вниманием (full-attention) на первом этапе остается замороженным и направляет третий этап.

tagСамодистилляция через разрыв внимания

Дистилляция здесь необычна. Мы не сжимаем большое大大大大模型 в 小模型. Учитель и ученик имеют одинаковый размер 0,6 млрд параметров и различаются только паттерном внимания. Учитель использует полное внимание (full attention) с квадратичными затратами; ученик использует архитектуру 3L2G.

Принуждение ученика одновременно переключать маски внимания и соответствовать выводам учителя приводит к провалу по обоим пунктам, поэтому рецепт разделяет эти два воздействия:

  • Этап I — учитель с полным вниманием. Начиная с публичного чекпоинта jina-reranker-v3, мы проводим полную дообучение учителя без ограничений скользящего окна на всей смеси данных v3.5. Это устанавливает потолок качества для данного бюджета параметров.
  • Этап II — адаптация разреженного внимания. Ученик инициализируется весами Этапа I и активирует 3L2G. Сначала мы обучаем только проекции внимания, замораживая все остальное, обучая разреженные маски передавать информацию, не нарушая представлений, изученных при полном внимании. Затем мы размораживаем все параметры, чтобы ученик подстроился под новую геометрию внимания. Ученик уже готов к развертыванию и работает быстрее, но на бенчмарках BEIR, RTEB-legal и MIRACL все еще сохраняется устойчивый разрыв по сравнению с учителем.
  • Этап III — дистилляция под руководством учителя. При замороженном учителе мы выравниваем ученика сразу по четырем уровням: списковое (listwise) KL-расхождение по нормализованным softmax распределениям оценок, MSE по абсолютным оценкам, MSE по скрытым состояниям последнего слоя и косинусная потеря на спроецированных 向量模型, плюс регуляризаторы контекстного сходства и дисперсии.

Порядок имеет значение. Второй этап сам по себе оставляет заметный разрыв, поскольку ученик должен изменить свою маршрутизацию под более слабой маской, прежде чем сможет безопасно имитировать оценки и состояния учителя. Третий этап затем устраняет большую часть этого разрыва, что говорит о том, что способность полного внимания передается разреженному ученику, как только геометрия адаптировалась. Рецепт написан для 3L2G, но схема обобщается и на другие несоответствия расписания внимания.

tagДанные для обучения

Смесь v3 хорошо покрывала общий поиск, но плохо справлялась со специализированными доменами. Вместо добавления большего объема данных мы провели анализ ошибок на наборах разработки RTEB и STARK и создали каждый новый сегмент данных так, чтобы он покрывал именно те паттерны поиска, с которыми не справляются общие модели. «Трудные» отрицательные примеры (hard negatives) поступают от нескольких поисковых систем одновременно (BM25, Jina, BGE, GTE, E5, ColBERT), поэтому модель не может выучить «короткие пути» какой-то одной системы.

Юридический сегмент объединяет мультиязычные данные EUR-Lex, CLERC, AILA, канадское прецедентное право, швейцарские резюме дел и EuroVoc; они перевыбраны, так как юридические тексты плотно насыщены цитатами и объемны. Медицинский сегмент нацелен на клиническую терминологию и насыщенные сущностями отрывки. Финансовый сегмент отдает приоритет числовым утверждениям, регуляторному языку и текстам с таблицами. Мультиязычное покрытие расширено за пределы MIRACL и mMARCO за счет WebFAQ на 50+ языках, межъязыковых отрицательных примеров SWIM-IR и японских пар Ruri-v3.

Структурированные данные получили наибольший вес при выборке, так как они находятся вне распределения обычного текста, которое предполагают стандартные бенчмарки. Релевантность записей и таблиц зависит от равенства, числовых и временных границ, вхождения в списки и логических комбинаций по полям, а не от лексического перекрытия. Ранние запуски показывали здесь худшие результаты, поэтому мы синтезировали пары с жесткими ограничениями напрямую.

Схема конвейера для генерации синтетических обучающих данных с жесткими ограничениями для структурированного поиска
Синтетический контроль для поиска с ограничениями по полям. Мы выбираем типизированные ограничения из опорной записи и заставляем 大大大大模型 перефразировать их в запрос, а затем изменяем одно или два ограниченных поля, чтобы создать почти идентичный «трудный» отрицательный пример, который сохраняет ту же поверхностную форму, но нарушает ограничение. Плотный майнинг добавляет новых кандидатов, а судья на базе 大大大大模型 продвигает истинные совпадения, уточняет слишком широкие запросы и отбрасывает неоднозначные случаи, возвращая данные в генератор запросов. Пример справа показывает, почему лексическое перекрытие здесь бесполезно: положительный и трудный отрицательный примеры являются идентичными строками, за исключением одного поля.

tagРезультаты экспериментов

Все числа получены путем переранжирования топ-100 кандидатов от jina-embeddings-v5-text-small в рамках единого конвейера MTEB v2, поэтому они могут немного отличаться от данных, заявленных поставщиками. Полные таблицы по каждому набору данных и языку приведены в статье.

МодельПараметрыBEIRMIRACLRTEBStruct-IR
jina-embeddings-v5-text-small (1-й этап)0.5 млрд56.2665.1564.60–
mxbai-rerank-base-v20.5 млрд59.5864.9061.4430.4
Qwen3-Reranker-0.6B0.6 млрд56.9467.1268.4141.9
mxbai-rerank-large-v21.5 млрд62.4569.6570.8143.0
Qwen3-Reranker-4B4.0 млрд62.2876.5677.6855.6
jina-reranker-v30.6 млрд62.1072.2068.0138.7
<strong>jina-reranker-v3.5</strong>0.6 млрд63.2074.1170.9548.3

Модель v3.5 превосходит v3 по всем семействам бенчмарков при том же количестве параметров, с наибольшим приростом в полуструктурированном поиске.

Прирост в RTEB сосредоточен там, где была нацелена смесь: AILA-Statute улучшился на 14.0 пунктов, AILA-Case — на 11.7 по сравнению с v3, а FinQA достигает 86.91, что является лучшим результатом среди всех протестированных моделей. На STARK v3.5 превосходит v3 по всем трем официальным метрикам и занимает первое место по Hit@5 в целом.

Примечание по протоколу Struct-IR. Бенчмарк индексирует миллионы объектов на схему, и Recall@5 первого этапа внутри схемы составляет около 0.04, поэтому сквозной процесс поиска и переранжирования почти полностью ограничен качеством первого этапа и плохо дифференцирует 重排器. Вместо этого мы вводим все эталонные документы вместе с 30 самыми сложными дистракторами первого этапа, что изолирует дискриминацию с ограничениями по полям от охвата поиска. Числа, полученные при таком подходе, несопоставимы с таблицей лидеров SSRB.

tagЭффективность

Измерено на одном NVIDIA A100, размер пакета 1, входные данные топ-100 спискового поиска, FlashAttention-2.

Столбчатая диаграмма, сравнивающая среднюю задержку спискового переранжирования v3 и v3.5 на BEIR Natural Questions
Режим короткого контекста, BEIR Natural Questions, средняя длина запроса и документа 10,3 и 145,5 词元 на 254 тестовых запросах. Средняя задержка спискового переранжирования топ-100 падает с 371 мс до 305 мс (ускорение в 1,22 раза), а пропускная способность документов возрастает с 270 до 328 док/с.
Столбчатая диаграмма, сравнивающая среднюю задержку спискового переранжирования v3 и v3.5 на RTEB AILACasedocs
Режим длинного контекста, RTEB AILACasedocs, средняя длина запроса и документа 689,8 и 1904,0 词元 на 48 тестовых запросах. Средняя задержка падает с 16,1 с до 10,3 с (ускорение в 1,56 раза), а пропускная способность префилла возрастает с 11,9 тыс. до 18,6 тыс. 词元/с. Гибридное внимание наиболее эффективно, когда кандидатные отрывки длинные.

Поскольку в промышленном списковом переранжировании доминирует одиночный префилл по набору свежих кандидатов, эти сокращения напрямую транслируются в возможность обработки более длинных списков кандидатов и более крупных документов при фиксированном бюджете ресурсов.

tagНачало работы

tagЧерез Jina Search Foundation API

curl -X POST \
  https://api.jina.ai/v1/rerank \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ***" \
  -d '{
  "model": "jina-reranker-v3.5",
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "documents": [
    "...",
    "..."
  ],
  "return_documents": false
}'

tagЧерез Elastic Inference Service

Модель jina-reranker-v3.5 доступна в Elastic Inference Service (EIS) начиная со стека 9.3, поэтому вы можете выполнять переранжирование на управляемых GPU без хостинга модели собственными силами. Создайте эндпоинт вывода (inference endpoint), ссылающийся на модель, а затем вызывайте его, как любую другую задачу rerank.

PUT _inference/rerank/eis-jina-reranker-v3-5
{
  "service": "elastic",
  "service_settings": {
    "model_id": "jina-reranker-v3.5"
  }
}
POST _inference/rerank/eis-jina-reranker-v3-5
{
  "query": "trail-running shoes under $150, rated 4.5+, released since 2022",
  "input": [
    "...",
    "..."
  ]
}

Ответ возвращает массив rerank, упорядоченный по релевантности, где каждая запись содержит исходный индекс кандидата и его оценку. Поскольку это стандартный эндпоинт вывода, на inference_id можно ссылаться напрямую из поискового запроса в объекте text_similarity_reranker.

tagЧерез transformers

from transformers import AutoModel

model = AutoModel.from_pretrained(
    'jinaai/jina-reranker-v3.5',
    dtype="auto",
    trust_remote_code=True,
)
model.eval()

query = "What are the health benefits of green tea?"
documents = [
    "Green tea contains catechins that may help reduce inflammation.",
    "El precio del cafe ha aumentado un 20% este ano.",
    "绿茶富含儿茶素等抗氧化剂,可以降低心脏病风险。",
    "Le the vert est riche en antioxydants.",
]

for r in model.rerank(query, documents):
    print(f"{r['relevance_score']:.4f}  {r['document'][:70]}")

tagЗаключение

Практическое преимущество jina-reranker-v3.5 является узкоспециализированным и поддается проверке: при 0,6 млрд параметров целенаправленное обучение сокращает большую часть разрыва с 4-миллиардным универсальным重排器 (reranker), а в бенчмарке BEIR этот разрыв устраняется полностью, при этом модель работает быстрее, чем та, которую она заменяет. Для корпоративного поиска это аргумент в пользу инвестирования в сфокусированное обучение на компактной базе, а не в использование самой большой доступной модели.

Стоит прямо обозначить два ограничения. Списочные (listwise)重排器 (reranker) по-прежнему имеют ограничения по входным данным, которых избегают поточечные (pointwise) модели и модели с поздним взаимодействием (late-interaction), в частности, фиксированные верхние границы по количеству кандидатов и их общей длине. Кроме того, остаются заметные отставания от модели Qwen на 4 млрд параметров в юридических и медицинских задачах RTEB, в структурированном поиске (Struct-IR) с контролируемым пулом, а также в языках с ограниченными ресурсами в рамках MIRACL. Это сложные случаи, и мы называем их открыто, а не скрываем за средними показателями.

Категории:
star
Избранное
пресс-релиз
rss_feed

Читать далее
май 12, 2026 • 7 минуты чтения
jina-embeddings-v5-omni: Embeddings for Text, Image, Audio and Video
Han Xiao
февраль 19, 2026 • 7 минуты чтения
jina-embeddings-v5-text: New SOTA Small Multilingual Embeddings
Han Xiao
Abstract digital artwork in black and white, featuring scattered dots forming letters in a halftone effect. The central lette
декабрь 04, 2025 • 7 минуты чтения
Jina-VLM: Small Multilingual Vision Language Model
Jina AI
Artistic representation of "Vln" in vibrant, rainbow-like colors on a minimalistic white background, with a focus on color di
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.