Elastic
Jina AI
模型
API
keyboard_arrow_down
Reader
把任意 URL 转成 Markdown,为大模型提供更好的事实依据。
向量模型
多模态多语言向量模型。
重排模型
让搜索相关性最大化的重排模型。
Elastic Inference Service
在 Elasticsearch 中原生运行 Jina 模型。
MCP
terminal
命令行
article
llms.txt
smart_toy
智能体
data_object
Schema
menu_book
文档
登录
login
重排模型
copyright CC BY-NC 4.0
open_in_new 发布博客

jina-reranker-m0

用于对视觉文档排序的多语言多模态重排模型
许可证
copyright CC-BY-NC-4.0
发布日期
calendar_month
2025-04-08
输入
abc
文本(查询)
image
图像(查询)
abc
文本(文档)
image
图像(文档)
arrow_forward
输出
format_list_numbered
排名
模型详情
参数: 2.4B
输入词元长度: 10K
输入图像尺寸: 768×28×28
底座模型 help_outline
open_in_new
Qwen2-VL-2B
已训练语言 help_outline
24 种语言
支持的语言 help_outline
29 种语言
量化版本 help_outline
GGUF
相关模型
link
jina-reranker-v2-base-multilingual
可通过以下方式获取
Jina API
AWS SageMaker
微软云
谷歌云
Hugging Face
物理隔离
I/O 图 1

多个

文本

文本

jina-reranker-m0

排序

I/O 图 2

多个

图像

文本

jina-reranker-m0

排序

I/O 图 3

多个

文本

图像

jina-reranker-m0

排序

I/O 图 4

多个

图像

图像

jina-reranker-m0

排序

Pareto fronthelp_outline
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameters (log)nDCG@5
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
取值分布help_outline
AUC 0.9383
语料
翻译对
文档检索
代码
图像 / 头图
图像 / 标识
0.7120.200.400.600.801.00
相关83.2%
困难负例24.7%
无关9.3%
推荐阈值
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
均衡 · 0.692
AUC
0.9383
噪声上限
0.965
召回悬崖
0.425
测量样本对
119 / 2,856
各名次得分help_outline
12345678910
各名次位置上的平均得分
谁排在第一位help_outline
119 个查询中有 66% 由正确结果夺得第一
选择要比较的模型

概述

jina-reranker-m0 是一款突破性的多模态多语言重排模型,用于对多语言视觉文档排序。它的过人之处在于能同时处理查询和视觉信息丰富的文档图像,涵盖含文字、图形、表格及各类版式的页面,支持 29 种语言,并按与查询的相关性输出排序后的文档列表。以往的重排模型受困于「模态鸿沟」问题,图像只与图像靠近、文本只与文本靠近,而 jina-reranker-m0 在单个纯解码器模型中统一了文本与视觉模态,能把图像和文本文档放在一起有效排序,带来顺畅的多模态搜索体验。

方法

jina-reranker-m0 的架构与以往方案有本质区别。它基于 24 亿参数的 Qwen2-VL-2B 构建,从经典的交叉编码器架构转向纯解码器的视觉语言模型。该方案沿用 Qwen2-VL 预训练好的视觉编码器和投影器,用 LoRA(低秩自适应)微调其大语言模型,并接一个后训练的 MLP 输出排序 logits,用于衡量查询与文档的相关性。这一判别式模型最多可处理 32K 词元,支持从 56×56 像素到 4K 分辨率的图像。处理图像时,视觉 Transformer(ViT)和投影器会把相邻的 2×2 词元合并为一个视觉词元,特殊词元则清晰标出视觉词元的边界,让语言模型能够统一整合视觉与文本信息并进行推理。

性能

Jina-reranker-m0 在多项基准测试中成绩亮眼。文本到文本重排方面,BEIR 上取得 58.95 NDCG-10,优于 jina-embeddings-v3(55.81)和 bge-reranker-v2-m3(56.51)等对手。多语言内容方面,覆盖 18 种语言的 MIRACL 上取得 66.75 NDCG-10。长文档方面,覆盖 13 种语言的 MLDR 上取得 59.83 NDCG-10。代码检索方面,CoIR 上取得 63.55 NDCG-10,大幅领先同类。而它真正的高光在视觉文档检索:ViDoRe 上取得 91.02 NDCG-5;在考察图文组合推理的 Winoground 上取得 43.92 的平均分,说明它在理解图文关系上明显强于其他模型。

最佳实践

要把 jina-reranker-m0 的潜力发挥到极致,开发者可参考以下几点。该模型可通过 API、云服务市场(AWS、Azure、GCP)调用,也可从 Hugging Face 下载本地部署。使用 API 时,可传入文本字符串、base64 图像或图像 URL,新用户可获赠一千万免费词元。得益于充分的训练,它在文本到文本、文本到图像、图像到文本以及文本到混合单模态等任务上表现优异;不过要注意,图像到图像等组合属于零样本支持,未做专门训练。为获得最佳效果,请记住模型最多支持 10K 输入词元,每张图像最多占 768 词元。纯解码器架构还带来了重排之外的更多可能:真正的混合模态重排、列表式重排、文档去重,以及借助注意力机制解释排序得分,这些都是此前纯编码器架构做不到的。
提及此模型的博客
十月 03, 2025 • 7 分钟阅读
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
八月 13, 2025 • 15 分钟阅读
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
七月 14, 2025 • 11 分钟阅读
Submodular Optimization for Text Selection, Passage Reranking & Context Engineering
While others rely on prompt tuning and hope for the best, you should learn submodular optimization that provides a principled framework with theoretical guarantees for better context engineering.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
六月 25, 2025 • 12 分钟阅读
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
五月 25, 2025 • 8 分钟阅读
Fair Scoring for Multimodal Documents with jina-reranker-m0
Text similarity: 0.7. Image similarity: 0.5. Which document is more relevant? You literally cannot tell—and that's the core problem breaking multimodal search. We solve it with unified reranking.
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
当前语言 / 主题
搜索底座
Reader
向量模型
重排模型
获取 Jina API 密钥
速率限制
关于我们
新闻
下载 Jina 徽标
open_in_new
下载 Elastic 徽标
open_in_new
API 状态
Elastic © 2026.安全条款及条件隐私管理 Cookie请勿出售或分享我的个人信息
本网站及其所有相关内容、软件、产品和服务仅供专业人士使用。不面向任何消费者,也不鼓励任何消费者使用。