Descripción general
jina-reranker-m0 es un reranker multimodal multilingüe de 2,4B parámetros basado en una arquitectura de modelo de visión-lenguaje. Es el primer reranker que maneja documentos visuales (texto, figuras, tablas, gráficos) en múltiples idiomas, alcanzando rendimiento state-of-the-art en ViDoRe (91,02 NDCG-5) y en recuperación de documentos largos multilingüe (MLDR). El modelo soporta reranking de texto-a-texto, texto-a-imagen, imagen-a-texto y modalidad mixta.
Métodos
El modelo se construye sobre una arquitectura VLM decoder-only (2,4B parámetros) que combina un vision encoder DFN CLIP ViT con un decodificador de lenguaje Qwen2. A diferencia de los cross-encoders tradicionales que procesan solo texto, el backbone VLM maneja de forma nativa tanto entradas de texto como de imagen, habilitando el reranking de documentos que contienen contenido visual (PDFs escaneados, infografías, presentaciones, tablas con figuras incrustadas). La ventana de contexto de 10K tokens acomoda hasta 768 tokens por imagen (procesadas como patches de 768×28×28). El entrenamiento usa un objetivo contrastivo multimodal sobre diversos tipos de documentos en múltiples idiomas. La arquitectura decoder-only habilita reranking listwise y abre posibilidades para deduplicación de documentos y explicabilidad de puntuaciones de ranking vía mecanismos de atención — capacidades no disponibles con arquitecturas encoder-only.
Rendimiento
En el reranking de texto-a-texto, el modelo logra 58,95 NDCG-10 en BEIR, superando a jina-embeddings-v3 (55,81) y bge-reranker-v2-m3 (56,51). Para contenido multilingüe, alcanza 66,75 NDCG-10 en MIRACL (18 idiomas). En el benchmark MLDR para documentos largos, logra 59,83 NDCG-10 en 13 idiomas. La recuperación de código alcanza 63,55 NDCG-10 en CoIR. El modelo destaca en la recuperación de documentos visuales: 91,02 NDCG-5 en ViDoRe y 43,92 promedio en Winoground (razonamiento composicional visiolingüístico). Algunas combinaciones de modalidades (p. ej., imagen-a-imagen) se soportan en modo zero-shot sin datos de entrenamiento específicos.
Guía
El modelo es accesible vía la API de Jina, los mercados AWS, Azure y GCP, o localmente a través de Hugging Face. Al usar la API, pase cadenas de texto, imágenes base64 o URLs de imágenes — los nuevos usuarios reciben 10M tokens gratis. El modelo soporta hasta 10K tokens de entrada con hasta 768 tokens por imagen. Para resultados óptimos, el modelo rinde mejor en tareas de texto-a-texto, texto-a-imagen, imagen-a-texto y texto-a-modalidad mixta; imagen-a-imagen es zero-shot. La arquitectura decoder-only habilita capacidades más allá del reranking simple: reranking de modalidad mixta, reranking listwise, deduplicación de documentos y explicabilidad de ranking basada en atención. Use este modelo cuando sus documentos contienen contenido visual (PDFs escaneados, gráficos, infografías) que los rerankers solo de texto no pueden manejar. Para reranking de texto puro a menor costo, use jina-reranker-v3.5.








