Gráfico de E/S 1

múltiple

Texto

Texto

jina-reranker-m0

Ranking

Gráfico de E/S 2

múltiple

Imagen

Texto

jina-reranker-m0

Ranking

Gráfico de E/S 3

múltiple

Texto

Imagen

jina-reranker-m0

Ranking

Gráfico de E/S 4

múltiple

Imagen

Imagen

jina-reranker-m0

Ranking

Frontera de Pareto
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parámetros (log)nDCG@5
Este modelo
En la frontera
Jina AI
Otros
ViDoRe v1
91.02
Parámetros
2.4B
Rango por score
7 / 24
Frontera de Pareto
Por detrás
Distribución de valores
AUC 0.9383
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
0.7120.200.400.600.801.00
Relacionados83.2%
Negativo difícil24.7%
No relacionados9.3%
Umbrales recomendados
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
equilibrado · 0.692
AUC
0.9383
Techo de ruido
0.965
Caída de exhaustividad
0.425
Pares medidos
119 / 2856
Puntuación por posición
12345678910
Puntuación media en cada posición
Qué gana el primer puesto
Una coincidencia correcta gana el 66 % de 119 consultas
Elija modelos para comparar

Descripción general

jina-reranker-m0 es un reranker multimodal multilingüe de 2,4B parámetros basado en una arquitectura de modelo de visión-lenguaje. Es el primer reranker que maneja documentos visuales (texto, figuras, tablas, gráficos) en múltiples idiomas, alcanzando rendimiento state-of-the-art en ViDoRe (91,02 NDCG-5) y en recuperación de documentos largos multilingüe (MLDR). El modelo soporta reranking de texto-a-texto, texto-a-imagen, imagen-a-texto y modalidad mixta.

Métodos

El modelo se construye sobre una arquitectura VLM decoder-only (2,4B parámetros) que combina un vision encoder DFN CLIP ViT con un decodificador de lenguaje Qwen2. A diferencia de los cross-encoders tradicionales que procesan solo texto, el backbone VLM maneja de forma nativa tanto entradas de texto como de imagen, habilitando el reranking de documentos que contienen contenido visual (PDFs escaneados, infografías, presentaciones, tablas con figuras incrustadas). La ventana de contexto de 10K tokens acomoda hasta 768 tokens por imagen (procesadas como patches de 768×28×28). El entrenamiento usa un objetivo contrastivo multimodal sobre diversos tipos de documentos en múltiples idiomas. La arquitectura decoder-only habilita reranking listwise y abre posibilidades para deduplicación de documentos y explicabilidad de puntuaciones de ranking vía mecanismos de atención — capacidades no disponibles con arquitecturas encoder-only.

Rendimiento

En el reranking de texto-a-texto, el modelo logra 58,95 NDCG-10 en BEIR, superando a jina-embeddings-v3 (55,81) y bge-reranker-v2-m3 (56,51). Para contenido multilingüe, alcanza 66,75 NDCG-10 en MIRACL (18 idiomas). En el benchmark MLDR para documentos largos, logra 59,83 NDCG-10 en 13 idiomas. La recuperación de código alcanza 63,55 NDCG-10 en CoIR. El modelo destaca en la recuperación de documentos visuales: 91,02 NDCG-5 en ViDoRe y 43,92 promedio en Winoground (razonamiento composicional visiolingüístico). Algunas combinaciones de modalidades (p. ej., imagen-a-imagen) se soportan en modo zero-shot sin datos de entrenamiento específicos.

Guía

El modelo es accesible vía la API de Jina, los mercados AWS, Azure y GCP, o localmente a través de Hugging Face. Al usar la API, pase cadenas de texto, imágenes base64 o URLs de imágenes — los nuevos usuarios reciben 10M tokens gratis. El modelo soporta hasta 10K tokens de entrada con hasta 768 tokens por imagen. Para resultados óptimos, el modelo rinde mejor en tareas de texto-a-texto, texto-a-imagen, imagen-a-texto y texto-a-modalidad mixta; imagen-a-imagen es zero-shot. La arquitectura decoder-only habilita capacidades más allá del reranking simple: reranking de modalidad mixta, reranking listwise, deduplicación de documentos y explicabilidad de ranking basada en atención. Use este modelo cuando sus documentos contienen contenido visual (PDFs escaneados, gráficos, infografías) que los rerankers solo de texto no pueden manejar. Para reranking de texto puro a menor costo, use jina-reranker-v3.5.

Blogs que mencionan este modelo
octubre 03, 2025 • 7 minutos de lectura
Jina Reranker v3: Reranker Listwise de 0.6B para la recuperación multilingüe SOTA
Nuevo reranker listwise de 0.6B parámetros que considera la consulta y todos los documentos candidatos en una sola ventana de contexto.
agosto 13, 2025 • 15 minutos de lectura
Optimización de GGUF para modelos de Embeddings solo de decodificador
4000 tokens/segundo para un modelo de 向量模型 de 3B parámetros en una GPU L4 es probablemente lo más rápido que conseguirás con llama.cpp. ¿O no?
julio 14, 2025 • 11 minutos de lectura
Optimización submodular para la selección de texto, el reordenamiento de pasajes y la ingeniería de contexto
Mientras que otros confían en el ajuste de *prompts* y esperan lo mejor, tú deberías aprender optimización submodular, que proporciona un marco de trabajo con principios y garantías teóricas para una mejor ingeniería de contexto.
junio 25, 2025 • 12 minutos de lectura
Jina Embeddings v4:向量模型 (Embeddings) 通用模型,适用于多模态多语言检索
Jina Embeddings v4 es un modelo de "向量模型 (Embeddings)" universal de 3.8 mil millones de parámetros para la recuperación multimodal y multilingüe que admite salidas de "向量模型 (Embeddings)" de un solo vector y de múltiples vectores.
mayo 25, 2025 • 8 minutos de lectura
Puntuación Justa para Documentos Multimodales con jina-reranker-m0
Similitud de texto: 0.7. Similitud de imagen: 0.5. ¿Qué documento es más relevante? Literalmente no se puede saber, y ese es el problema principal que está afectando a la búsqueda multimodal. Lo solucionamos con la función de reordenamiento unificada (unified reranking).