Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Реранкер
copyright CC BY-NC 4.0
open_in_new Пост о релизе

jina-reranker-m0

Многоязычная мультимодальная модель реранкера для ранжирования визуальных документов
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2025-04-08
Вход
abc
Текст (Запрос)
image
Изображение (Запрос)
abc
Текст (Документ)
image
Изображение (Документ)
arrow_forward
Выход
format_list_numbered
Рейтинги
Подробности модели
Параметры: 2.4B
Длина входного токена: 10K
Размер входного изображения: 768×28×28
Базовая модель help_outline
open_in_new
Qwen2-VL-2B
open_in_new
DFN CLIP ViT
Обученные языки help_outline
24 языки
Поддерживаемые языки help_outline
29 языки
Квантования help_outline
GGUF
Похожие модели
link
jina-reranker-v2-base-multilingual
Доступно через
API Jina AI
AWS SageMaker
Microsoft Azure
Google Облако
Hugging Face
Air-gapped
График ввода-вывода 1

несколько

Текст

Текст

jina-reranker-m0

Ранжирование

График ввода-вывода 2

несколько

Изображение

Текст

jina-reranker-m0

Ранжирование

График ввода-вывода 3

несколько

Текст

Изображение

jina-reranker-m0

Ранжирование

График ввода-вывода 4

несколько

Изображение

Изображение

jina-reranker-m0

Ранжирование

Парето-фронт help_outline
workspace_premium
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Параметры (лог)nDCG@5
Эта модель
На фронте
Jina AI
Другие
ViDoRe v1
91.02
Параметры
2.4B
Ранг по баллу
7 / 24
Парето-фронт
Позади
Распределение значенийhelp_outline
AUC 0.9383
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
0.7120.200.400.600.801.00
Связанные83.2%
Сложный отрицательный24.7%
Несвязанные9.3%
Рекомендуемые пороги
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
сбалансированный · 0.692
AUC
0.9383
Потолок шума
0.965
Обрыв полноты
0.425
Измерено пар
119 / 2,856
Оценка по позицииhelp_outline
12345678910
Средняя оценка на каждой позиции
Кто занимает первое местоhelp_outline
Верное совпадение выигрывает в 66 % из 119 запросов
Выберите модели для сравнения

Обзор

jina-reranker-m0 — мультимодальный мультиязычный реранкер на 2,4B параметров, основанный на архитектуре vision-language модели. Это первый реранкер, обрабатывающий визуальные документы (текст, рисунки, таблицы, диаграммы) на нескольких языках, достигающий state-of-the-art качества на ViDoRe (91,02 NDCG-5) и в мультиязычном поиске длинных документов (MLDR). Модель поддерживает text-to-text, text-to-image, image-to-text и смешанно-модальный ранкинг.

Методы

Модель построена на decoder-only VLM архитектуре (2,4B параметров), объединяющей vision-энкодер DFN CLIP ViT с языковым декодером Qwen2. В отличие от традиционных cross-encoders, обрабатывающих только текст, VLM-база нативно обрабатывает и текстовые, и изображенческие входы, позволяя ранжировать документы с визуальным содержимым (отсканированные PDF, инфографика, слайд-деки, таблицы с вложенными рисунками). Контекстное окно в 10K токенов вмещает до 768 токенов на изображение (обрабатывается как патчи 768×28×28). Обучение использует мультимодальную контрастивную целевую функцию на разнообразных типах документов на нескольких языках. Decoder-only архитектура позволяет listwise-ранжирование и открывает возможности для дедупликации документов и объяснимости ранговых оценок через механизмы внимания — способности, недоступные encoder-only архитектурам.

Производительность

В text-to-text ранжировании модель набирает 58,95 NDCG-10 на BEIR, превосходя jina-embeddings-v3 (55,81) и bge-reranker-v2-m3 (56,51). Для мультиязычного контента она достигает 66,75 NDCG-10 на MIRACL (18 языков). На бенчмарке MLDR для длинных документов она набирает 59,83 NDCG-10 по 13 языкам. Кодовый поиск достигает 63,55 NDCG-10 на CoIR. Модель блистает в поиске визуальных документов: 91,02 NDCG-5 на ViDoRe и 43,92 в среднем на Winoground (визуально-языковое композиционное рассуждение). Некоторые комбинации модальностей (например, image-to-image) поддерживаются в zero-shot режиме без специфических обучающих данных.

Руководство

Модель доступна через Jina API, маркетплейсы AWS, Azure, GCP или локально через Hugging Face. При использовании API передавайте текстовые строки, base64-изображения или URL изображений — новые пользователи получают 10M бесплатных токенов. Модель поддерживает до 10K входных токенов с до 768 токенов на изображение. Для оптимальных результатов модель лучше всего работает на задачах text-to-text, text-to-image, image-to-text и text-to-mixed-modality; image-to-image — zero-shot. Decoder-only архитектура открывает возможности, выходящие за рамки простого ранжирования: смешанный мультимодальный ранкинг, listwise-ранжирование, дедупликация документов и объяснимость ранга на основе внимания. Используйте эту модель, когда ваши документы содержат визуальное содержимое (отсканированные PDF, диаграммы, инфографику), с которым текстовые реранкеры не справляются. Для чистого текстового ранжирования по меньшей цене используйте jina-reranker-v3.5.

Блоги, в которых упоминается эта модель
октябрь 03, 2025 • 7 минуты чтения
Jina Reranker v3: 0.6B Listwise Reranker для SOTA Мультиязычного Поиска
Новый списочный реранкер с 0.6B параметрами, который рассматривает запрос и все документы-кандидаты в едином контекстном окне.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
август 13, 2025 • 15 минуты чтения
Оптимизация GGUF для моделей формирования векторных представлений только с декодером
4000词元/сек для модели 向量模型 с 3 миллиардами параметров на графическом процессоре L4 — это, вероятно, предел скорости, которого вы достигнете с llama.cpp. Или нет?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
июль 14, 2025 • 11 минуты чтения
Субмодульная оптимизация для выбора текста, переранжирования пассажей и контекстной инженерии
В то время как другие полагаются на настройку подсказок и надеются на лучшее, вам следует изучить субмодульную оптимизацию, которая предоставляет принципиальную основу с теоретическими гарантиями для улучшения инженерии контекста.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
июнь 25, 2025 • 12 минуты чтения
Jina Embeddings v4: Универсальные векторные модели (Embeddings) для мультимодального многоязыкового поиска
Jina Embeddings v4 — это универсальная модель векторного представления (Embeddings) с 3,8 миллиардами параметров для мультимодального и многоязыкового поиска, которая поддерживает вывод как одно-, так и многовекторных векторных представлений (Embeddings).
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
май 25, 2025 • 8 минуты чтения
Справедливая оценка для мультимодальных документов с помощью jina-reranker-m0
Текстовое сходство: 0.7. Сходство изображений: 0.5. Какой документ более релевантен? Вы буквально не можете сказать — и это основная проблема, ломающая мультимодальный поиск. Мы решаем ее с помощью унифицированного переранжирования (unified reranking).
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.