График ввода-вывода 1
График ввода-вывода 2
График ввода-вывода 3
График ввода-вывода 4
Pareto fronthelp_outline
chevron_leftchevron_right
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Распределение значенийhelp_outlineAUC 0.9383
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
Связанные83.2%
Сложный отрицательный24.7%
Несвязанные9.3%
Рекомендуемые пороги
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
сбалансированный · 0.692
AUC
0.9383
Потолок шума
0.965
Обрыв полноты
0.425
Измерено пар
119 / 2,856
Оценка по позицииhelp_outline
Средняя оценка на каждой позиции
Кто занимает первое местоhelp_outline
Верное совпадение выигрывает в 66 % из 119 запросов
Выберите модели для сравнения
Обзор
jina-reranker-m0 — это новаторская мультимодальная многоязычная модель реранжера, разработанная для ранжирования визуальных документов на нескольких языках. Исключительной эту модель делает ее способность обрабатывать запросы вместе с визуально насыщенными изображениями документов, включая страницы с текстом, рисунками, таблицами и различными макетами, на 29 языках. Модель выводит ранжированный список документов, упорядоченных по их релевантности входному запросу. В отличие от предыдущих реранжеров, которые боролись с проблемой «разрыва модальности» (когда изображения группировались рядом с другими изображениями, а текст группировался рядом с текстом), jina-reranker-m0 объединяет текстовые и визуальные модальности в одной модели, работающей только с декодером, создавая бесшовный мультимодальный поисковый опыт, который может эффективно ранжировать как изображения, так и текстовые документы вместе.
Методы
Архитектура jina-reranker-m0 представляет собой значительный отход от предыдущих подходов. Построенная на основе Qwen2-VL-2B с 2,4 миллиардами параметров, она переходит от классической кросс-кодировочной архитектуры к языковой модели, использующей только декодер. Система использует предварительно обученный визуальный кодировщик и проектор Qwen2-VL, дорабатывает свою большую языковую модель с помощью LoRA (Low-Rank Adaptation) и применяет постобученный MLP для генерации ранжирующих логитов, измеряющих релевантность запроса и документа. Эта дискриминативная модель может обрабатывать до 32 000 токенов и поддерживает изображения от 56×56 пикселей до разрешения 4K. При обработке изображений Vision Transformer (ViT) и проектор объединяют смежные токены 2×2 в единые визуальные токены, а специальные токены четко обозначают границы визуальных токенов, позволяя языковой модели правильно интегрировать и анализировать как визуальные, так и текстовые элементы.
Производительность
Jina-reranker-m0 достигает впечатляющих результатов в нескольких бенчмарках. В переранжировании текста в текст он набирает 58,95 NDCG-10 на бенчмарке BEIR, превосходя таких конкурентов, как jina-embeddings-v3 (55,81) и bge-reranker-v2-m3 (56,51). Для многоязычного контента он набирает 66,75 NDCG-10 на бенчмарке MIRACL, охватывающем 18 языков. В бенчмарке MLDR для длинных документов он набирает 59,83 NDCG-10 на 13 языках. Для извлечения кода на бенчмарке CoIR он набирает 63,55 NDCG-10, значительно превосходя конкурентов. Но эта модель действительно блистает в визуальном поиске документов — в тесте ViDoRe она набирает впечатляющие 91,02 балла NDCG-5, а в тесте Winoground, который тестирует визуально-лингвистическое композиционное мышление, она набирает средний балл 43,92, что демонстрирует ее превосходную способность понимать связи между текстом и изображениями по сравнению с другими моделями.
Руководство
Чтобы максимально раскрыть потенциал jina-reranker-m0, разработчикам следует рассмотреть несколько стратегий внедрения. Модель доступна через API, облачные сервисные площадки (AWS, Azure, GCP) или локально через Hugging Face. При использовании API разработчики могут передавать текстовые строки, изображения base64 или URL-адреса изображений, а новые пользователи могут получить десять миллионов бесплатных токенов. Хотя модель исключительно хорошо работает с задачами «текст-текст», «текст-изображение», «изображение-текст» и «текст-смешанный-унимодальный» благодаря обширному обучению, стоит отметить, что некоторые комбинации (например, «изображение-изображение») поддерживаются в нулевом режиме без специального обучения. Для достижения оптимальных результатов помните, что модель поддерживает до 10 тыс. входных токенов с до 768 токенов на изображение. Подход архитектуры, основанный только на декодере, открывает возможности, выходящие за рамки простого переранжирования, включая истинное смешанное переранжирование, переранжирование по спискам, дедупликацию документов и объяснимость оценок ранжирования с помощью механизмов внимания — возможности, которые были недостижимы с помощью предыдущих архитектур, основанных только на кодере.
Блоги, в которых упоминается эта модель








