Imagina que estás creando un sistema de búsqueda de noticias deportivas. Un usuario busca "jugadores de tenis celebrando la victoria del campeonato" y necesitas encontrar los artículos más relevantes de tu base de datos. Cada artículo contiene tanto un texto como una imagen, algo típico de la cobertura deportiva moderna.
Tu sistema necesita tomar una consulta de texto y devolver una lista clasificada de los documentos multimodales más relevantes de tu corpus. Suena sencillo, pero hay un problema fundamental que rompe todos los enfoques obvios.
Esto es lo que sucede cuando intentas clasificar estos documentos. Tu modelo de "向量模型 (embedding)" digamos jina-clip-v2 produce puntuaciones de similitud como esta:
| Artículo | Tipo de contenido | Descripción | Puntuación de similitud |
|---|---|---|---|
| A | Texto | Novak Djokovic gana la final del Abierto de Australia en sets corridos | 0.72 |
| A | Imagen | [foto de un jugador sosteniendo un trofeo y sonriendo] | 0.31 |
| B | Texto | Los retrasos climáticos afectan la programación del torneo al aire libre | 0.23 |
| B | Imagen | [foto de jugadores de tenis saltando y celebrando] | 0.54 |
¿Qué artículo es más relevante? El artículo A tiene una puntuación de texto alta pero una puntuación de imagen baja. El artículo B tiene una puntuación de texto baja pero una puntuación de imagen más alta. El desafío fundamental es que no puedes comparar 0.72 (texto) con 0.54 (imagen) porque estas puntuaciones de similitud existen en escalas completamente diferentes.
tagCuando las soluciones triviales fallan

Debido a la brecha de modalidad en jina-clip-v2 o en casi todos los demás modelos similares a CLIP, cualquier enfoque obvio que puedas intentar no funciona. Si solo usas la puntuación más alta, te encuentras con el hecho de que las puntuaciones de texto se agrupan alrededor de 0.2-0.8, mientras que las puntuaciones de imagen se agrupan alrededor de 0.4-0.6. Esto significa que una coincidencia de texto mediocre (0.6) siempre vencerá a una coincidencia de imagen excelente (0.5).
Promediar las puntuaciones tampoco ayuda. Calcular (0.7 + 0.3)/2 = 0.5 te da un número, pero ¿qué significa realmente? Estás promediando cantidades fundamentalmente sin sentido. De manera similar, cualquier esquema de ponderación fija es arbitrario: a veces el texto importa más, a veces las imágenes, y esto depende completamente de la consulta y el documento específicos.
Incluso normalizar las puntuaciones primero no resuelve el problema central. Todavía estás tratando de combinar medidas de similitud fundamentalmente diferentes que capturan diferentes aspectos de la relevancia.
tagLo que realmente sucede

Para tener una mejor idea de con qué estamos trabajando, aquí hay un documento de ejemplo del conjunto de datos EDIS, que muestra la imagen (un partido de fútbol alemán) y el título (One More Field Where the Content Trails Germany).

En general, jina-clip-v2 muestra similitudes mucho mayores al comparar consulta a texto que consulta a imagen en el conjunto de datos EDIS, en parte debido a la forma en que se entrenó el modelo y en parte debido al propio conjunto de datos:

Por lo tanto, parece lógico recuperar un documento en función de su texto en lugar de su imagen. Y, como podemos ver en el gráfico a continuación, obtenemos resultados mucho mejores al comparar la consulta de texto ... for undocumented immigrants helping to establish legal status in the United States con el contenido de texto del corpus. De hecho, la búsqueda por imagen no logra recuperar el documento de verdad fundamental (resaltado en amarillo) en absoluto:

top_k de 3.Pero no te dejes engañar. A pesar de que la consulta a texto muestra puntuaciones de similitud más altas, las puntuaciones de similitud de consulta a texto y consulta a imagen no son comparables. Podemos ver esto al observar recall@10 cuando usamos jina-clip-v2 para recuperar 32 documentos del conjunto de datos EDIS. Claramente, el recall es más alto con consulta a imagen:
| Recall@10 | |
|---|---|
| Consulta a texto | 14.55 |
| Consulta a imagen | 22.38 |
Podemos ver esto a continuación: si usamos una consulta del conjunto de datos, Ear ear An elephant is decorated with Bhartiya Janta Party symbols near the BJP headquarters in New Delhi., podemos recuperar el documento de verdad fundamental solo por su contenido de imagen. La búsqueda por su contenido de texto no devuelve ninguna coincidencia:

top_k de 3.Entonces, si las puntuaciones de similitud implican que deberíamos recuperar documentos de su texto, y la exhaustividad implica que deberíamos recuperarlos de sus imágenes, ¿qué deberíamos elegir? Ciertamente, las figuras 3 y 4 no sugieren un ganador absoluto. ¿Qué modalidad presenta realmente la coincidencia más cercana entre nuestra consulta y el documento que estamos buscando? Y si queremos fusionar candidatos tanto de la recuperación de consulta a texto como de la recuperación de consulta a imagen, ¿cómo podemos seleccionar significativamente las mejores coincidencias si ni siquiera podemos comparar las puntuaciones? Claramente, solo usar jina-clip-v2 no será suficiente. Necesitamos añadir otro modelo a la mezcla.
tagUna canalización simple de dos etapas
En abril de 2025 lanzamos jina-reranker-m0, un 重排器 (Reranker) multimodal multilingüe para recuperar documentos visuales. Podemos ver su brecha de modalidad más estrecha a continuación, donde jina-reranker-m0 muestra puntuaciones de similitud comparables de consulta a texto y de consulta a imagen, en contraste con la brecha mucho más amplia que muestra jina-clip-v2:

Con esto en mente, podemos usar jina-reranker-m0 para una segunda pasada en la cadena de recuperación, después de que los resultados iniciales se recuperen de jina-clip-v2:
Etapa 1: Recuperar candidatos de ambas modalidades
- Usar jina-clip-v2 para obtener 16 documentos mediante búsqueda de texto + 16 mediante búsqueda de imagen
- Aceptar que aún no podemos comparar las puntuaciones
Etapa 2: 重排 (Reranking) unificado
- Introducir cada par (consulta + documento completo) en jina-reranker-m0
- El 重排器 (Reranker) procesa tanto el texto COMO la imagen juntos
- Salida: Puntuación de relevancia única en una escala unificada

Ampliamos los experimentos de la Tabla 1, ahora usando jina-clip-v2 para recuperar documentos del corpus, luego jina-reranker-m0 para volver a clasificarlos:
- Recuperar 32 documentos mediante consulta a texto, luego volver a clasificarlos según la puntuación de consulta a texto.
- Recuperar 32 documentos mediante consulta a imagen, luego volver a clasificarlos según la puntuación de consulta a imagen.
- Recuperar 16 documentos mediante consulta a texto y 16 mediante consulta a imagen. Volver a clasificarlos según la puntuación de consulta a texto o consulta a imagen, según la modalidad de la consulta.
- Recuperar 16 documentos mediante consulta a texto y 16 mediante consulta a imagen. Volver a clasificarlos según las puntuaciones promedio de consulta a texto y consulta a imagen de cada documento, dando una puntuación final de (consulta a texto + consulta a imagen)/2.
| Experiment | Description | Recall@10 - with jina-clip-v2 | Recall@10 - with jina-reranker-m0 |
|---|---|---|---|
| 1 | 32 docs: query-to-text | 14.55 | 17.42 |
| 2 | 32 docs: query-to-image | 22.38 | 28.94 |
| 3 | 16 docs: query-to-text 16 docs: query-to-image |
14.55 | 33.81 |
| 4 | 16 docs: query-to-text 16 docs: query-to-image Combined average reranker scores |
14.55 | 36.24 |
Como podemos ver, al realizar una segunda pasada con jina-reranker-m0, la exhaustividad aumenta en todos los ámbitos, independientemente de la modalidad. Sin embargo, vemos el mayor aumento cuando combinamos el contenido textual y de imagen de los documentos recuperados, alcanzando una exhaustividad@10 de 36.24. Un ejemplo visual muestra que jina-reranker-m0 clasifica consistentemente el documento de verdad fundamental en primer lugar, ya sea buscando contenido de texto o de imagen:

top_k de 1 resultado para cada metodología de 重排 (Reranking) (cuatro columnas a la derecha), que muestra que la combinación de puntuaciones de similitud de imagen y texto clasifica consistentemente el documento de verdad fundamental en primer lugar.top_k de 3 para los diferentes métodos de recuperación, por razones de espacio, la figura 7 muestra solo top_k de 1 para cada consulta.tagConclusiones
Este enfoque simple de dos etapas ofrece una mejora del 62% en la exhaustividad porque el sistema finalmente aprovecha lo que los humanos hacen de forma natural: considerar tanto lo que leemos como lo que vemos para determinar la relevancia. La lección se extiende más allá de la búsqueda: cuando se trata de sistemas de IA multimodales, los enfoques de una sola pasada que tratan las modalidades por separado siempre se toparán con este muro de incompatibilidad de puntuación. Las arquitecturas de dos etapas que recuperan ampliamente y luego clasifican de forma inteligente se están volviendo esenciales. Pruebe jina-reranker-m0 a través de nuestra API o en AWS, GCP y Azure.








