Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Cuando las soluciones triviales fallan
Lo que realmente sucede
Una canalización simple de dos etapas
Conclusiones
Blog de tecnología
mayo 25, 2025

Puntuación Justa para Documentos Multimodales con jina-reranker-m0

Similitud de texto: 0.7. Similitud de imagen: 0.5. ¿Qué documento es más relevante? Literalmente no se puede saber, y ese es el problema principal que está afectando a la búsqueda multimodal. Lo solucionamos con la función de reordenamiento unificada (unified reranking).
Nan Wang, Alex C-G • 8 minutos de lectura

Imagina que estás creando un sistema de búsqueda de noticias deportivas. Un usuario busca "jugadores de tenis celebrando la victoria del campeonato" y necesitas encontrar los artículos más relevantes de tu base de datos. Cada artículo contiene tanto un texto como una imagen, algo típico de la cobertura deportiva moderna.

Tu sistema necesita tomar una consulta de texto y devolver una lista clasificada de los documentos multimodales más relevantes de tu corpus. Suena sencillo, pero hay un problema fundamental que rompe todos los enfoques obvios.

Esto es lo que sucede cuando intentas clasificar estos documentos. Tu modelo de "向量模型 (embedding)" digamos jina-clip-v2 produce puntuaciones de similitud como esta:

Artículo Tipo de contenido Descripción Puntuación de similitud
A Texto Novak Djokovic gana la final del Abierto de Australia en sets corridos 0.72
A Imagen [foto de un jugador sosteniendo un trofeo y sonriendo] 0.31
B Texto Los retrasos climáticos afectan la programación del torneo al aire libre 0.23
B Imagen [foto de jugadores de tenis saltando y celebrando] 0.54

¿Qué artículo es más relevante? El artículo A tiene una puntuación de texto alta pero una puntuación de imagen baja. El artículo B tiene una puntuación de texto baja pero una puntuación de imagen más alta. El desafío fundamental es que no puedes comparar 0.72 (texto) con 0.54 (imagen) porque estas puntuaciones de similitud existen en escalas completamente diferentes.

tagCuando las soluciones triviales fallan

The What and Why of Text-Image Modality Gap in CLIP Models
You can’t just use a CLIP model to retrieve text and images and sort the results by score. Why? Because of the modality gap. What is it, and where does it come from?
Jina AIBo Wang, Scott Martens

Debido a la brecha de modalidad en jina-clip-v2 o en casi todos los demás modelos similares a CLIP, cualquier enfoque obvio que puedas intentar no funciona. Si solo usas la puntuación más alta, te encuentras con el hecho de que las puntuaciones de texto se agrupan alrededor de 0.2-0.8, mientras que las puntuaciones de imagen se agrupan alrededor de 0.4-0.6. Esto significa que una coincidencia de texto mediocre (0.6) siempre vencerá a una coincidencia de imagen excelente (0.5).

Promediar las puntuaciones tampoco ayuda. Calcular (0.7 + 0.3)/2 = 0.5 te da un número, pero ¿qué significa realmente? Estás promediando cantidades fundamentalmente sin sentido. De manera similar, cualquier esquema de ponderación fija es arbitrario: a veces el texto importa más, a veces las imágenes, y esto depende completamente de la consulta y el documento específicos.

Incluso normalizar las puntuaciones primero no resuelve el problema central. Todavía estás tratando de combinar medidas de similitud fundamentalmente diferentes que capturan diferentes aspectos de la relevancia.

tagLo que realmente sucede

EDIS: Entity-Driven Image Search over Multimodal Web Content
Making image retrieval methods practical for real-world search applications requires significant progress in dataset scales, entity comprehension, and multimodal information fusion. In this work, we introduce \textbf{E}ntity-\textbf{D}riven \textbf{I}mage \textbf{S}earch (EDIS), a challenging dataset for cross-modal image search in the news domain. EDIS consists of 1 million web images from actual search engine results and curated datasets, with each image paired with a textual description. Unlike datasets that assume a small set of single-modality candidates, EDIS reflects real-world web image search scenarios by including a million multimodal image-text pairs as candidates. EDIS encourages the development of retrieval models that simultaneously address cross-modal information fusion and matching. To achieve accurate ranking results, a model must: 1) understand named entities and events from text queries, 2) ground entities onto images or text descriptions, and 3) effectively fuse textual and visual representations. Our experimental results show that EDIS challenges state-of-the-art methods with dense entities and a large-scale candidate set. The ablation study also proves that fusing textual features with visual features is critical in improving retrieval results.
arXiv.orgSiqi Liu

Para tener una mejor idea de con qué estamos trabajando, aquí hay un documento de ejemplo del conjunto de datos EDIS, que muestra la imagen (un partido de fútbol alemán) y el título (One More Field Where the Content Trails Germany).

Figura 1: Documento multimodal de ejemplo que contiene tanto imagen como texto. Dado que tenemos dos modalidades, para cualquier consulta dada ahora hay dos brechas semánticas (entre la consulta y el texto, y la consulta y la imagen). Para obtener los mejores resultados, ¿deberíamos buscar en el contenido de texto de los documentos o en el contenido de la imagen?

En general, jina-clip-v2 muestra similitudes mucho mayores al comparar consulta a texto que consulta a imagen en el conjunto de datos EDIS, en parte debido a la forma en que se entrenó el modelo y en parte debido al propio conjunto de datos:

Figura 2: Puntuaciones de similitud entre consulta a imagen (en rojo) y consulta a texto (en azul) usando jina-clip-v2.

Por lo tanto, parece lógico recuperar un documento en función de su texto en lugar de su imagen. Y, como podemos ver en el gráfico a continuación, obtenemos resultados mucho mejores al comparar la consulta de texto ... for undocumented immigrants helping to establish legal status in the United States con el contenido de texto del corpus. De hecho, la búsqueda por imagen no logra recuperar el documento de verdad fundamental (resaltado en amarillo) en absoluto:

Figura 3: Ejemplo donde el documento de verdad fundamental (resaltado con borde amarillo) se puede recuperar solo a través de la recuperación de consulta a texto de jina-clip-v2 al usar top_k de 3.

Pero no te dejes engañar. A pesar de que la consulta a texto muestra puntuaciones de similitud más altas, las puntuaciones de similitud de consulta a texto y consulta a imagen no son comparables. Podemos ver esto al observar recall@10 cuando usamos jina-clip-v2 para recuperar 32 documentos del conjunto de datos EDIS. Claramente, el recall es más alto con consulta a imagen:

Recall@10
Consulta a texto 14.55
Consulta a imagen 22.38

Podemos ver esto a continuación: si usamos una consulta del conjunto de datos, Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi., podemos recuperar el documento de verdad fundamental solo por su contenido de imagen. La búsqueda por su contenido de texto no devuelve ninguna coincidencia:

Figura 4: Ejemplo donde el documento de verdad fundamental (resaltado con borde amarillo) se puede recuperar solo a través de la recuperación de consulta a imagen de jina-clip-v2 al usar top_k de 3.

Entonces, si las puntuaciones de similitud implican que deberíamos recuperar documentos de su texto, y la exhaustividad implica que deberíamos recuperarlos de sus imágenes, ¿qué deberíamos elegir? Ciertamente, las figuras 3 y 4 no sugieren un ganador absoluto. ¿Qué modalidad presenta realmente la coincidencia más cercana entre nuestra consulta y el documento que estamos buscando? Y si queremos fusionar candidatos tanto de la recuperación de consulta a texto como de la recuperación de consulta a imagen, ¿cómo podemos seleccionar significativamente las mejores coincidencias si ni siquiera podemos comparar las puntuaciones? Claramente, solo usar jina-clip-v2 no será suficiente. Necesitamos añadir otro modelo a la mezcla.

tagUna canalización simple de dos etapas

En abril de 2025 lanzamos jina-reranker-m0, un 重排器 (Reranker) multimodal multilingüe para recuperar documentos visuales. Podemos ver su brecha de modalidad más estrecha a continuación, donde jina-reranker-m0 muestra puntuaciones de similitud comparables de consulta a texto y de consulta a imagen, en contraste con la brecha mucho más amplia que muestra jina-clip-v2:

Figura 6: En comparación con jina-clip-v2, jina-reranker-m0 muestra mucha menos diferencia entre las puntuaciones de similitud de consulta a imagen (rojo) y de consulta a texto (azul).

Con esto en mente, podemos usar jina-reranker-m0 para una segunda pasada en la cadena de recuperación, después de que los resultados iniciales se recuperen de jina-clip-v2:

Etapa 1: Recuperar candidatos de ambas modalidades

  • Usar jina-clip-v2 para obtener 16 documentos mediante búsqueda de texto + 16 mediante búsqueda de imagen
  • Aceptar que aún no podemos comparar las puntuaciones

Etapa 2: 重排 (Reranking) unificado

  • Introducir cada par (consulta + documento completo) en jina-reranker-m0
  • El 重排器 (Reranker) procesa tanto el texto COMO la imagen juntos
  • Salida: Puntuación de relevancia única en una escala unificada
Figura 5: Indexación de documentos multimodales y un proceso de recuperación multimodal de dos etapas con jina-clip-v2 y jina-reranker-m0.

Ampliamos los experimentos de la Tabla 1, ahora usando jina-clip-v2 para recuperar documentos del corpus, luego jina-reranker-m0 para volver a clasificarlos:

  1. Recuperar 32 documentos mediante consulta a texto, luego volver a clasificarlos según la puntuación de consulta a texto.
  2. Recuperar 32 documentos mediante consulta a imagen, luego volver a clasificarlos según la puntuación de consulta a imagen.
  3. Recuperar 16 documentos mediante consulta a texto y 16 mediante consulta a imagen. Volver a clasificarlos según la puntuación de consulta a texto o consulta a imagen, según la modalidad de la consulta.
  4. Recuperar 16 documentos mediante consulta a texto y 16 mediante consulta a imagen. Volver a clasificarlos según las puntuaciones promedio de consulta a texto y consulta a imagen de cada documento, dando una puntuación final de (consulta a texto + consulta a imagen)/2.
💡
Tenga en cuenta que estamos midiendo el rendimiento zero-shot en EDIS. No ajustamos ni jina-clip-v2 ni jina-reranker-m0 usando el conjunto de datos.
Experiment Description Recall@10 - with jina-clip-v2 Recall@10 - with jina-reranker-m0
1 32 docs: query-to-text 14.55 17.42
2 32 docs: query-to-image 22.38 28.94
3 16 docs: query-to-text
16 docs: query-to-image
14.55 33.81
4 16 docs: query-to-text
16 docs: query-to-image
Combined average reranker scores
14.55 36.24
💡
Los experimentos 1, 3 y 4 muestran el mismo resultado para recall@10 con jina-clip-v2 debido a que las puntuaciones de consulta a texto son más altas que las puntuaciones de consulta a imagen. Por lo tanto, los diez mejores resultados están dominados por los documentos recuperados a través del texto.

Como podemos ver, al realizar una segunda pasada con jina-reranker-m0, la exhaustividad aumenta en todos los ámbitos, independientemente de la modalidad. Sin embargo, vemos el mayor aumento cuando combinamos el contenido textual y de imagen de los documentos recuperados, alcanzando una exhaustividad@10 de 36.24. Un ejemplo visual muestra que jina-reranker-m0 clasifica consistentemente el documento de verdad fundamental en primer lugar, ya sea buscando contenido de texto o de imagen:

Figura 7: Consultas de muestra (a la izquierda) y top_k de 1 resultado para cada metodología de 重排 (Reranking) (cuatro columnas a la derecha), que muestra que la combinación de puntuaciones de similitud de imagen y texto clasifica consistentemente el documento de verdad fundamental en primer lugar.
💡
Si bien las figuras 3 y 4 muestran un top_k de 3 para los diferentes métodos de recuperación, por razones de espacio, la figura 7 muestra solo top_k de 1 para cada consulta.

tagConclusiones

Este enfoque simple de dos etapas ofrece una mejora del 62% en la exhaustividad porque el sistema finalmente aprovecha lo que los humanos hacen de forma natural: considerar tanto lo que leemos como lo que vemos para determinar la relevancia. La lección se extiende más allá de la búsqueda: cuando se trata de sistemas de IA multimodales, los enfoques de una sola pasada que tratan las modalidades por separado siempre se toparán con este muro de incompatibilidad de puntuación. Las arquitecturas de dos etapas que recuperan ampliamente y luego clasifican de forma inteligente se están volviendo esenciales. Pruebe jina-reranker-m0 a través de nuestra API o en AWS, GCP y Azure.

Categorías:
Blog de tecnología
rss_feed

Leer más
marzo 11, 2026 • 7 minutos de lectura
Bootstrapping Audio Embeddings from Multimodal LLMs
Han Xiao
Abstract illustration of a sound wave or heartbeat, formed by blue, orange, and gray dots on a white background.
marzo 06, 2026 • 6 minutos de lectura
Identifying Embedding Models from Raw Numerical Values
Han Xiao
Fingerprint illustration made from numbers, showcasing digital and high-tech design on a light background.
septiembre 09, 2025 • 11 minutos de lectura
Multimodal Embeddings in Llama.cpp and GGUF
Andrei Ungureanu
Alex C-G
Cartoon llama in the center of a white background, emitting laser-like beams from its eyes. The illustration creates a playfu
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.