Обзор
jina-reranker-m0 — мультимодальный мультиязычный реранкер на 2,4B параметров, основанный на архитектуре vision-language модели. Это первый реранкер, обрабатывающий визуальные документы (текст, рисунки, таблицы, диаграммы) на нескольких языках, достигающий state-of-the-art качества на ViDoRe (91,02 NDCG-5) и в мультиязычном поиске длинных документов (MLDR). Модель поддерживает text-to-text, text-to-image, image-to-text и смешанно-модальный ранкинг.
Методы
Модель построена на decoder-only VLM архитектуре (2,4B параметров), объединяющей vision-энкодер DFN CLIP ViT с языковым декодером Qwen2. В отличие от традиционных cross-encoders, обрабатывающих только текст, VLM-база нативно обрабатывает и текстовые, и изображенческие входы, позволяя ранжировать документы с визуальным содержимым (отсканированные PDF, инфографика, слайд-деки, таблицы с вложенными рисунками). Контекстное окно в 10K токенов вмещает до 768 токенов на изображение (обрабатывается как патчи 768×28×28). Обучение использует мультимодальную контрастивную целевую функцию на разнообразных типах документов на нескольких языках. Decoder-only архитектура позволяет listwise-ранжирование и открывает возможности для дедупликации документов и объяснимости ранговых оценок через механизмы внимания — способности, недоступные encoder-only архитектурам.
Производительность
В text-to-text ранжировании модель набирает 58,95 NDCG-10 на BEIR, превосходя jina-embeddings-v3 (55,81) и bge-reranker-v2-m3 (56,51). Для мультиязычного контента она достигает 66,75 NDCG-10 на MIRACL (18 языков). На бенчмарке MLDR для длинных документов она набирает 59,83 NDCG-10 по 13 языкам. Кодовый поиск достигает 63,55 NDCG-10 на CoIR. Модель блистает в поиске визуальных документов: 91,02 NDCG-5 на ViDoRe и 43,92 в среднем на Winoground (визуально-языковое композиционное рассуждение). Некоторые комбинации модальностей (например, image-to-image) поддерживаются в zero-shot режиме без специфических обучающих данных.
Руководство
Модель доступна через Jina API, маркетплейсы AWS, Azure, GCP или локально через Hugging Face. При использовании API передавайте текстовые строки, base64-изображения или URL изображений — новые пользователи получают 10M бесплатных токенов. Модель поддерживает до 10K входных токенов с до 768 токенов на изображение. Для оптимальных результатов модель лучше всего работает на задачах text-to-text, text-to-image, image-to-text и text-to-mixed-modality; image-to-image — zero-shot. Decoder-only архитектура открывает возможности, выходящие за рамки простого ранжирования: смешанный мультимодальный ранкинг, listwise-ранжирование, дедупликация документов и объяснимость ранга на основе внимания. Используйте эту модель, когда ваши документы содержат визуальное содержимое (отсканированные PDF, диаграммы, инфографику), с которым текстовые реранкеры не справляются. Для чистого текстового ранжирования по меньшей цене используйте jina-reranker-v3.5.








