Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
reclasificador
copyright CC BY-NC 4.0
open_in_new Publicación de lanzamiento

jina-reranker-m0

Modelo de reranking multimodal multilingüe para la clasificación de documentos visuales
Licencia
copyright CC-BY-NC-4.0
Fecha de lanzamiento
calendar_month
2025-04-08
Aporte
abc
Texto (Consulta)
image
Imagen (Consulta)
abc
Texto (Documento)
image
Imagen (Documento)
arrow_forward
Producción
format_list_numbered
Clasificaciones
Detalles del modelo
Parámetros: 2.4B
Longitud del token de entrada: 10K
Tamaño de la imagen de entrada: 768×28×28
Modelo base help_outline
open_in_new
Qwen2-VL-2B
Idiomas entrenados help_outline
24 idiomas
Idiomas admitidos help_outline
29 idiomas
Cuantizaciones help_outline
GGUF
Modelos relacionados
link
jina-reranker-v2-base-multilingual
Disponible a través de
API de Jina
AWS SageMaker
Microsoft Azure
Nube de Google
Hugging Face
Air-gapped
Gráfico de E/S 1

múltiple

Texto

Texto

jina-reranker-m0

Categoría

Gráfico de E/S 2

múltiple

Imagen

Texto

jina-reranker-m0

Categoría

Gráfico de E/S 3

múltiple

Texto

Imagen

jina-reranker-m0

Categoría

Gráfico de E/S 4

múltiple

Imagen

Imagen

jina-reranker-m0

Categoría

Pareto fronthelp_outline
BEIR
MIRACL
ViDoRe v1
chevron_leftchevron_right
300M1B3.0B10B707580859095Argus-Colqwen3.5-2b-v0Argus-Colqwen3.5-9b-v0ColFlorColModernVBERTcolnomic-embed-multimod…colpali-v1.1ColPali-v1.2colpali-v1.3colqwen2-v1.0colSmol-256McolSmol-500MMonoQwen2-VL-v0.1SauerkrautLM-ColQwen3-1…SauerkrautLM-ColQwen3-2…Parameters (log)nDCG@5
This model
On the front
Jina AI
Other
ViDoRe v1
91.02
Parameters
2.4B
Rank by score
7 / 24
Pareto front
Behind it
Distribución de valoreshelp_outline
AUC 0.9383
Corpus
Pares de traducción
Búsqueda documental
Código
Imagen / banner
Imagen / logotipo
0.7120.200.400.600.801.00
Relacionados83.2%
Negativo difícil24.7%
No relacionados9.3%
Umbrales recomendados
FPR 0.1 · 0.712
FPR 0.01 · 0.938
FPR 0.001 · 0.968
FPR 0.0001 · 0.972
equilibrado · 0.692
AUC
0.9383
Techo de ruido
0.965
Caída de exhaustividad
0.425
Pares medidos
119 / 2,856
Puntuación por posiciónhelp_outline
12345678910
Puntuación media en cada posición
Qué gana el primer puestohelp_outline
Una coincidencia correcta gana el 66 % de 119 consultas
Elige modelos para comparar

Descripción general

jina-reranker-m0 es un innovador modelo de reranking multimodal y multilingüe, diseñado para clasificar documentos visuales en varios idiomas. Lo que hace excepcional a este modelo es su capacidad para procesar consultas junto con imágenes de documentos visualmente ricas (incluyendo páginas con texto, figuras, tablas y diversos diseños) en 29 idiomas. El modelo genera una lista de documentos ordenados por su relevancia para la consulta de entrada. A diferencia de los rerankers anteriores que presentaban dificultades con el problema de la "brecha de modalidad" (donde las imágenes se agrupaban cerca de otras imágenes mientras que el texto se agrupaba cerca del texto), jina-reranker-m0 unifica las modalidades textual y visual en un único modelo basado únicamente en decodificador, creando una experiencia de búsqueda multimodal fluida que permite clasificar eficazmente tanto imágenes como documentos de texto.

Métodos

La arquitectura de jina-reranker-m0 representa un cambio significativo respecto a los enfoques anteriores. Basado en Qwen2-VL-2B con 2400 millones de parámetros, evoluciona de una arquitectura clásica de codificador cruzado a un modelo de lenguaje de visión basado únicamente en decodificador. El sistema aprovecha el codificador y proyector de visión preentrenados de Qwen2-VL, ajusta su modelo de lenguaje grande con LoRA (adaptación de bajo rango) y emplea un MLP posentrenado para generar logits de clasificación que miden la relevancia de la consulta y el documento. Este modelo discriminativo puede gestionar hasta 32 000 tokens y admite imágenes desde 56×56 píxeles hasta resolución 4K. Al procesar imágenes, el Transformador de Visión (ViT) y el proyector condensan los tokens adyacentes de 2×2 en tokens visuales individuales, mientras que tokens especiales marcan claramente los límites de los tokens visuales, lo que permite que el modelo de lenguaje se integre y razone correctamente entre elementos visuales y textuales.

Actuación

Jina-reranker-m0 obtiene resultados impresionantes en múltiples pruebas de referencia. En la reclasificación de texto a texto, obtiene una puntuación de 58,95 NDCG-10 en la prueba BEIR, superando a competidores como jina-embeddings-v3 (55,81) y bge-reranker-v2-m3 (56,51). Para contenido multilingüe, obtiene una puntuación de 66,75 NDCG-10 en la prueba MIRACL, que abarca 18 idiomas. En la prueba MLDR para documentos largos, obtiene una puntuación de 59,83 NDCG-10 en 13 idiomas. En la recuperación de código, en la prueba CoIR, obtiene una puntuación de 63,55 NDCG-10, superando significativamente a la competencia. Pero el modelo realmente brilla en la recuperación de documentos visuales: en el benchmark ViDoRe, obtiene un impresionante puntaje de 91,02 NDCG-5, mientras que en Winoground, que prueba el razonamiento compositivo visolingüístico, alcanza un puntaje promedio de 43,92, lo que demuestra su capacidad superior para comprender las relaciones entre texto e imágenes en comparación con otros modelos.

Guía

Para maximizar el potencial de jina-reranker-m0, los desarrolladores deben considerar varias estrategias de implementación. El modelo es accesible mediante API, marketplaces de servicios en la nube (AWS, Azure, GCP) o localmente a través de Hugging Face. Al usar la API, los desarrolladores pueden pasar cadenas de texto, imágenes base64 o URL de imágenes, y los nuevos usuarios pueden optar a diez millones de tokens gratuitos. Si bien el modelo funciona excepcionalmente bien en tareas de texto a texto, texto a imagen, imagen a texto y texto a unimodal mixto gracias a un entrenamiento exhaustivo, cabe destacar que algunas combinaciones (como imagen a imagen) se admiten en modo zero-shot, sin entrenamiento específico. Para obtener resultados óptimos, recuerde que el modelo admite hasta 10 000 tokens de entrada con hasta 768 tokens por imagen. El enfoque de solo decodificador de la arquitectura abre posibilidades más allá de la simple reclasificación, incluida la reclasificación de modalidad mixta real, la reclasificación por lista, la deduplicación de documentos y la explicabilidad de la puntuación de clasificación a través de mecanismos de atención, capacidades que no se podían lograr con arquitecturas anteriores de solo codificador.
Blogs que mencionan este modelo
octubre 03, 2025 • 7 minutos de lectura
Jina Reranker v3: 0.6B Listwise Reranker for SOTA Multilingual Retrieval
New 0.6B-parameter listwise reranker that considers the query and all candidate documents in a single context window.
Jina AI
Light blue background with stylized text in the center, composed of small dots or squares, evoking a modern and minimalistic
agosto 13, 2025 • 15 minutos de lectura
Optimizing GGUFs for Decoder-Only Embedding Models
4000 tokens/sec for a 3B-parameter embedding model on L4 GPU is probably as fast as you'll get with llama.cpp. Or is it?
Han Xiao
Text "DGUF for Embedding Models" written in yellow on a dark background, conveying a sleek, minimalistic, digital design.
julio 14, 2025 • 11 minutos de lectura
Submodular Optimization for Text Selection, Passage Reranking & Context Engineering
While others rely on prompt tuning and hope for the best, you should learn submodular optimization that provides a principled framework with theoretical guarantees for better context engineering.
Han Xiao
Network illustration of interconnected hexagons, some solid and some hollow blue, connected by red lines indicating paths or
junio 25, 2025 • 12 minutos de lectura
Jina Embeddings v4: Universal Embeddings for Multimodal Multilingual Retrieval
Jina Embeddings v4 is a 3.8 billion parameter universal embedding model for multimodal and multilingual retrieval that supports both single-vector and multi-vector embedding outputs.
Jina AI
Word "Embeddings" followed by a numeric or symbol representation, displayed in multiple colors on a technology-themed, colorf
mayo 25, 2025 • 8 minutos de lectura
Fair Scoring for Multimodal Documents with jina-reranker-m0
Text similarity: 0.7. Image similarity: 0.5. Which document is more relevant? You literally cannot tell—and that's the core problem breaking multimodal search. We solve it with unified reranking.
Nan Wang
Alex C-G
Stacked glowing green ovals on a background transitioning from black to green, with the top oval having an unusual, split sha
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.