SIGIR (Special Interest Group on Information Retrieval) es una conferencia de primer nivel sobre recuperación de información que reúne a investigadores, desarrolladores, expertos de la industria y educadores de todo el mundo para compartir las últimas investigaciones innovadoras. Jina AI estuvo en la conferencia de este año en Padua en julio, presentando nuestro trabajo sobre late chunking en el Robust IR Workshop.
La conferencia de este año presentó investigaciones asombrosas, especialmente en métodos de reordenamiento, modelos de recuperación dispersos y el uso de LLM en la recuperación de información. Los aspectos más destacados incluyen las ponencias magistrales de Stephen Robertson sobre la historia y el desarrollo del algoritmo de clasificación BM25 y de Iryna Gurevych sobre perspectivas para el futuro de la IA en la investigación científica. Los expertos y los entusiastas estudiantes de doctorado asistentes provocaron muchos debates animados. La conferencia tuvo lugar en el Centro de Congresos de Padua, situado en el corazón de la ciudad. Padua en sí es un lugar rico en historia y cultura, y disfrutamos mucho de nuestro tiempo allí.
tagLate Chunking en Robust IR
El Robust IR workshop es un nuevo evento en SIGIR, que se celebró por primera vez este año. Se centró en lo bien que operan los sistemas de recuperación de información en situaciones difíciles y excepcionales, y en cómo podemos mejorar su solidez. El taller fue una mezcla de charlas invitadas y presentaciones orales de los trabajos aceptados, así como una mesa redonda.
Presentamos nuestro trabajo sobre late chunking en la sesión de carteles del taller. Hubo muchas preguntas y comentarios perspicaces, bastantes de personas que ya habían leído nuestra preimpresión.




Download the poster from Google Drive
tagInvestigación interesante
Encontramos una gran cantidad de investigaciones interesantes presentadas en SIGIR, pero el trabajo a continuación nos llamó la atención.
tagCLIP-AdaM: Adaptación de CLIP multivista para la recuperación de objetos 3D de conjunto abierto
Este artículo se centró en la recuperación de imágenes 3D, específicamente la recuperación de objetos 3D de conjunto abierto, que es la tarea de recuperar objetos 3D para categorías de objetos no vistas previamente, sin haber sido entrenados para ellos. Su enfoque utiliza vistas renderizadas de modelos 3D desde múltiples ángulos para reconocer objetos utilizando modelos CLIP entrenados en imágenes planas. Un hallazgo interesante del artículo es que los modelos CLIP funcionan bien al promediar los vectores modelo generados a partir de diferentes vistas del objeto.

Más allá de eso, el artículo propone un nuevo método de entrenamiento para la recuperación de objetos 3D que aprende a ponderar diferentes vistas, así como capas adaptativas que ajustan el modelo para tareas específicas al tiempo que evitan el sobreajuste en las categorías de datos de entrenamiento y mejoran el rendimiento de disparo cero en nuevas categorías.
tagOptimización de sistemas de recuperación compuestos
La mayoría de los sistemas de clasificación existentes, que combinan varios modelos de clasificación para producir resultados, se basan en cascadas de clasificación. Esto significa que un modelo de clasificación se ejecuta después de otro, y cada uno conserva solo los resultados con la mejor puntuación del anterior.
Este artículo propone un enfoque diferente que denomina sistemas de recuperación compuestos: un marco para combinar diferentes reordenadores para maximizar la precisión de la clasificación y la eficiencia computacional. Los autores proponen entenderlo como una generalización del enfoque de cascada, que ejecuta múltiples reordenadores en diferentes subconjuntos de los resultados de las etapas de clasificación anteriores.
La figura siguiente se da en el artículo para mostrar cómo se pueden combinar diferentes reordenadores.

En su ejemplo, un clasificador de primera etapa produce una clasificación inicial. Luego, la segunda etapa utiliza dos reordenadores con diferentes enfoques de clasificación:
- Un modelo de clasificación puntual que produce una puntuación de relevancia para los documentos del primer clasificador, basada en una consulta.
- Un modelo de clasificación por pares que compara dos documentos y la consulta y genera una probabilidad estimada de que uno de los dos sea más relevante para la consulta que el otro.
Cada modelo tiene una política de selección que se aplica a los resultados de la etapa de clasificación anterior; por ejemplo, tomar solo los n mejores. También hay una función de ordenación final que produce el resultado final. Tanto la política de selección como la función de ordenación tienen parámetros establecidos por el entrenamiento, lo que permite una optimización holística que produce resultados mejores y más robustos.
tagRE-AdaptIR: Improving Information Retrieval through Reverse Engineered Adaptation
Se ha investigado mucho el uso de técnicas de álgebra lineal para optimizar los pesos del modelo de vectorización. Por ejemplo, el método de sopa de modelos mejora la precisión y la robustez del modelo al promediar los pesos de los modelos que resultan de ajustar el mismo modelo base con diferentes hiperparámetros.

La investigación presentada en este artículo ofrece una idea relacionada: ¿Podemos utilizar el vector de diferencias entre los pesos de un modelo de vectorización ajustado y su base no ajustada para transferir el aprendizaje de un modelo a otro? Si ajustamos otra copia del modelo base en la predicción del siguiente token para texto específico del dominio y luego añadimos las diferencias de peso del modelo de vectorización entrenado, ¿obtendremos un mejor modelo de vectorización para el dominio de destino?

Esto tiene importantes ventajas para el entrenamiento de modelos para nuevos dominios. Permite utilizar abundantes datos de texto plano para entrenar la predicción del siguiente token y, a continuación, disfrutar de una mejora de las vectorizaciones como resultado.
tagBenchmarking LLM-based Relevance Judgment Methods
Este artículo evalúa las estrategias de Prompt para utilizar los LLM como jueces de relevancia, incluyendo su uso para juicios binarios (sí/no), evaluaciones graduadas (es decir, escalas de 0 a 4), comparaciones por pares de documentos para la relevancia y métodos "basados en fragmentos", que deciden si un documento contiene información específica.
Los autores concluyen, a partir de las pruebas con GPT-4o y Llama 3, que los resultados están más alineados con los juicios humanos cuando el LLM tiene menos opciones. Los juicios binarios y las comparaciones por pares funcionan mejor y, con modelos de IA muy potentes, son lo suficientemente buenos para un uso automatizado a gran escala. Un buen diseño de Prompt es un factor crítico.
Los métodos basados en fragmentos permiten la interpretabilidad humana, pero son menos fiables.
tagRankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluation
Este artículo explora cuestiones relacionadas con el uso de LLM en tres funciones distintas: clasificar los resultados, juzgar la relevancia y evaluar los resultados, y funciones de apoyo como la síntesis de resultados y la expansión de consultas.
Considera las consecuencias del uso de LLM en todo el ciclo de la información, como se muestra en la figura siguiente, extraída del artículo.

El artículo concluye que existen problemas importantes en el uso de juicios basados en LLM para evaluar sistemas de recuperación de información que a su vez se basan en LLM. La interacción de los diferentes componentes basados en LLM puede conducir sin duda a resultados sesgados e inexactos.
tagLLM-Driven Usefulness Labeling for IR Evaluation
Este artículo distingue entre relevancia y utilidad en los resultados de búsqueda. La relevancia, en su definición, se refiere a si el tema de un documento recuperado está relacionado temáticamente con la consulta; la utilidad se refiere a si el documento responde a la consulta, es decir, si cumple la intención del usuario.
Su objetivo es determinar si los LLM pueden reconocer y clasificar la utilidad y si sus juicios se alinean con los humanos. Concluyen que existe una alineación significativa entre los jueces humanos de utilidad y los LLM. Sin embargo, los LLM disponibles tienen dificultades con los casos en los que la relevancia y la utilidad no están alineadas, es decir, los documentos relevantes pero no útiles. Los autores descubren que proporcionar a los LLM más información de contexto, en lugar de solo consultas de texto, mejora significativamente los resultados.
tagLLM-based Relevance Assessment Still Can’t Replace Human Relevance Assessment
El artículo analiza el uso de LLM para la evaluación automática de la relevancia en la recuperación de información, lo que facilitaría mucho el entrenamiento de modelos de recuperación, ya que nunca hay suficientes datos clasificados por humanos. Aunque algunos estudios recientes afirman que los LLM pueden sustituir por completo a los evaluadores humanos, este artículo identifica las limitaciones clave que impiden que los LLM sustituyan al juicio humano.
- Evidencia insuficiente y generalización limitada de la investigación actual: La investigación actual carece de pruebas sólidas de que los LLM puedan sustituir por completo los juicios de relevancia humanos, especialmente en diversos conjuntos de datos y escenarios del mundo real. Cuando existen resultados positivos, es discutible si realmente se aplican a dominios amplios.
- Vulnerabilidad a la manipulación: Las métricas automatizadas, incluidas las basadas en LLM, pueden manipularse fácilmente. Es muy fácil mejorar las puntuaciones sin mejorar realmente el rendimiento.
- Sesgo de autopreferencia: Los LLM tienden a favorecer los resultados similares a sus propios datos de entrenamiento, introduciendo un sesgo que compromete la objetividad de las evaluaciones de relevancia.
- Riesgos de sobreajuste: Confiar en las evaluaciones basadas en LLM puede hacer que los sistemas de recuperación se optimicen para las idiosincrasias de los LLM específicos, reduciendo el rendimiento en el uso del mundo real.
tagConclusión
El rápido auge de los grandes modelos lingüísticos ha transformado significativamente la recuperación de información, sustituyendo a métodos establecidos como BM25 y abriendo nuevas posibilidades. La investigación mostrada en SIGIR destaca esta transformación.
Sin embargo, los modelos lingüísticos no convierten la recuperación de información en un problema resuelto. La conferencia presentó una amplia gama de ideas innovadoras destinadas a alinear los sistemas de RI más estrechamente con las necesidades cambiantes de los usuarios. Realmente disfrutamos conectando con estudiantes de doctorado y expertos, intercambiando ideas y compartiendo nuestra visión del futuro de la búsqueda en Jina AI. Estamos entusiasmados de seguir superando los límites de lo que es posible en este campo.










