Elastic
Jina AI
Модели
API
keyboard_arrow_down
Читатель
Читайте URL-адреса и ищите информацию в Интернете для получения более подходящей подготовки для получения степени магистра права.
Вложения
Мультимодальные многоязычные векторные представления.
Реранкер
Инструмент переранжирования для максимизации релевантности результатов поиска.
Elastic Inference Service
Запускайте модели Jina непосредственно в Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документы
Авторизоваться
login
Реранкер
copyright CC BY-NC 4.0
open_in_new Выпуск Пост

jina-reranker-m0

Многоязычная мультимодальная модель реранжировщика для ранжирования визуальных документов
Лицензия
copyright CC-BY-NC-4.0
Дата выпуска
calendar_month
2025-04-08
Вход
abc
Текст (Запрос)
image
Изображение (Запрос)
abc
Текст (Документ)
image
Изображение (Документ)
arrow_forward
Выход
format_list_numbered
Рейтинги
Подробности модели
Параметры: 2.4B
Длина входного токена: 10K
Размер входного изображения: 768×28×28
Базовая модель help_outline
open_in_new
Qwen2-VL-2B
Обученные языки help_outline
24 языки
Поддерживаемые языки help_outline
29 языки
Квантования help_outline
GGUF
Похожие модели
link
jina-reranker-v2-base-multilingual
Доступно через
API Джина
AWS SageMaker
Microsoft Azure
Google Облако
Hugging Face
Air-gapped
График ввода-вывода 1

несколько

Текст

Текст

jina-reranker-m0

Рейтинг

График ввода-вывода 2

несколько

Изображение

Текст

jina-reranker-m0

Рейтинг

График ввода-вывода 3

несколько

Текст

Изображение

jina-reranker-m0

Рейтинг

График ввода-вывода 4

несколько

Изображение

Изображение

jina-reranker-m0

Рейтинг

Pareto fronthelp_outline
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameters (log)nDCG@5
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Распределение значенийhelp_outline
AUC 0.9383
Корпус
Пары переводов
Поиск по документации
Код
Изображение / баннер
Изображение / логотип
0.7120.200.400.600.801.00
Связанные83.2%
Сложный отрицательный24.7%
Несвязанные9.3%
Рекомендуемые пороги
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
сбалансированный · 0.692
AUC
0.9383
Потолок шума
0.965
Обрыв полноты
0.425
Измерено пар
119 / 2,856
Оценка по позицииhelp_outline
12345678910
Средняя оценка на каждой позиции
Кто занимает первое местоhelp_outline
Верное совпадение выигрывает в 66 % из 119 запросов
Выберите модели для сравнения

Обзор

jina-reranker-m0 — это новаторская мультимодальная многоязычная модель реранжера, разработанная для ранжирования визуальных документов на нескольких языках. Исключительной эту модель делает ее способность обрабатывать запросы вместе с визуально насыщенными изображениями документов, включая страницы с текстом, рисунками, таблицами и различными макетами, на 29 языках. Модель выводит ранжированный список документов, упорядоченных по их релевантности входному запросу. В отличие от предыдущих реранжеров, которые боролись с проблемой «разрыва модальности» (когда изображения группировались рядом с другими изображениями, а текст группировался рядом с текстом), jina-reranker-m0 объединяет текстовые и визуальные модальности в одной модели, работающей только с декодером, создавая бесшовный мультимодальный поисковый опыт, который может эффективно ранжировать как изображения, так и текстовые документы вместе.

Методы

Архитектура jina-reranker-m0 представляет собой значительный отход от предыдущих подходов. Построенная на основе Qwen2-VL-2B с 2,4 миллиардами параметров, она переходит от классической кросс-кодировочной архитектуры к языковой модели, использующей только декодер. Система использует предварительно обученный визуальный кодировщик и проектор Qwen2-VL, дорабатывает свою большую языковую модель с помощью LoRA (Low-Rank Adaptation) и применяет постобученный MLP для генерации ранжирующих логитов, измеряющих релевантность запроса и документа. Эта дискриминативная модель может обрабатывать до 32 000 токенов и поддерживает изображения от 56×56 пикселей до разрешения 4K. При обработке изображений Vision Transformer (ViT) и проектор объединяют смежные токены 2×2 в единые визуальные токены, а специальные токены четко обозначают границы визуальных токенов, позволяя языковой модели правильно интегрировать и анализировать как визуальные, так и текстовые элементы.

Производительность

Jina-reranker-m0 достигает впечатляющих результатов в нескольких бенчмарках. В переранжировании текста в текст он набирает 58,95 NDCG-10 на бенчмарке BEIR, превосходя таких конкурентов, как jina-embeddings-v3 (55,81) и bge-reranker-v2-m3 (56,51). Для многоязычного контента он набирает 66,75 NDCG-10 на бенчмарке MIRACL, охватывающем 18 языков. В бенчмарке MLDR для длинных документов он набирает 59,83 NDCG-10 на 13 языках. Для извлечения кода на бенчмарке CoIR он набирает 63,55 NDCG-10, значительно превосходя конкурентов. Но эта модель действительно блистает в визуальном поиске документов — в тесте ViDoRe она набирает впечатляющие 91,02 балла NDCG-5, а в тесте Winoground, который тестирует визуально-лингвистическое композиционное мышление, она набирает средний балл 43,92, что демонстрирует ее превосходную способность понимать связи между текстом и изображениями по сравнению с другими моделями.

Руководство

Чтобы максимально раскрыть потенциал jina-reranker-m0, разработчикам следует рассмотреть несколько стратегий внедрения. Модель доступна через API, облачные сервисные площадки (AWS, Azure, GCP) или локально через Hugging Face. При использовании API разработчики могут передавать текстовые строки, изображения base64 или URL-адреса изображений, а новые пользователи могут получить десять миллионов бесплатных токенов. Хотя модель исключительно хорошо работает с задачами «текст-текст», «текст-изображение», «изображение-текст» и «текст-смешанный-унимодальный» благодаря обширному обучению, стоит отметить, что некоторые комбинации (например, «изображение-изображение») поддерживаются в нулевом режиме без специального обучения. Для достижения оптимальных результатов помните, что модель поддерживает до 10 тыс. входных токенов с до 768 токенов на изображение. Подход архитектуры, основанный только на декодере, открывает возможности, выходящие за рамки простого переранжирования, включая истинное смешанное переранжирование, переранжирование по спискам, дедупликацию документов и объяснимость оценок ранжирования с помощью механизмов внимания — возможности, которые были недостижимы с помощью предыдущих архитектур, основанных только на кодере.
Блоги, в которых упоминается эта модель
октябрь 03, 2025 • 7 минуты чтения
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
август 13, 2025 • 15 минуты чтения
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
июль 14, 2025 • 11 минуты чтения
Submodular Optimization for Text Selection, Passage Reranking & Context Engineering
While others rely on prompt tuning and hope for the best, you should learn submodular optimization that provides a principled framework with theoretical guarantees for better context engineering.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
июнь 25, 2025 • 12 минуты чтения
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
май 25, 2025 • 8 минуты чтения
Fair Scoring for Multimodal Documents with jina-reranker-m0
Text similarity: 0.7. Image similarity: 0.5. Which document is more relevant? You literally cannot tell—and that's the core problem breaking multimodal search. We solve it with unified reranking.
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Текущий язык / тема
Search Foundation
Читатель
Вложения
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.