Elastic
Jina AI
Modelos
API
keyboard_arrow_down
Lector
Lea las URL y busque en la web para obtener una base más sólida para su LLM.
Incrustaciones
Incrustaciones multimodales y multilingües.
reclasificador
Reclasificador para maximizar la relevancia de los resultados de búsqueda.
Elastic Inference Service
Ejecuta modelos Jina de forma nativa dentro de Elasticsearch.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agentes
data_object
Esquema
menu_book
Documentos
Acceso
login
Late Chunking en Robust IR
Investigación interesante
Conclusión
Evento
agosto 11, 2025

Lo que aprendimos en SIGIR 2025

Compartiendo lo que vimos y aprendimos en SIGIR 2025, con CLIP-AdaM, RE-AdaptIR y evaluaciones para sistemas de recuperación basados en LLM.
Michael Günther, Bo Wang, Scott Martens • 8 minutos de lectura

SIGIR (Special Interest Group on Information Retrieval) es una conferencia de primer nivel sobre recuperación de información que reúne a investigadores, desarrolladores, expertos de la industria y educadores de todo el mundo para compartir las últimas investigaciones innovadoras. Jina AI estuvo en la conferencia de este año en Padua en julio, presentando nuestro trabajo sobre late chunking en el Robust IR Workshop.

La conferencia de este año presentó investigaciones asombrosas, especialmente en métodos de reordenamiento, modelos de recuperación dispersos y el uso de LLM en la recuperación de información. Los aspectos más destacados incluyen las ponencias magistrales de Stephen Robertson sobre la historia y el desarrollo del algoritmo de clasificación BM25 y de Iryna Gurevych sobre perspectivas para el futuro de la IA en la investigación científica. Los expertos y los entusiastas estudiantes de doctorado asistentes provocaron muchos debates animados. La conferencia tuvo lugar en el Centro de Congresos de Padua, situado en el corazón de la ciudad. Padua en sí es un lugar rico en historia y cultura, y disfrutamos mucho de nuestro tiempo allí.

tagLate Chunking en Robust IR

El Robust IR workshop es un nuevo evento en SIGIR, que se celebró por primera vez este año. Se centró en lo bien que operan los sistemas de recuperación de información en situaciones difíciles y excepcionales, y en cómo podemos mejorar su solidez. El taller fue una mezcla de charlas invitadas y presentaciones orales de los trabajos aceptados, así como una mesa redonda.

Presentamos nuestro trabajo sobre late chunking en la sesión de carteles del taller. Hubo muchas preguntas y comentarios perspicaces, bastantes de personas que ya habían leído nuestra preimpresión.

Late Chunking in Long-Context Embedding Models
Chunking long documents while preserving contextual information is challenging. We introduce the “Late Chunking” that leverages long-context embedding models to generate contextual chunk embeddings for better retrieval applications.
Jina AIMichael Günther, Han Xiao
What Late Chunking Really Is & What It’s Not: Part II
Part 2 of our exploration of Late Chunking, a deep dive into why it is the best method for chunk embeddings and improving search/RAG performance.
Jina AIHan Xiao
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding Models
Many use cases require retrieving smaller portions of text, and dense vector-based retrieval systems often perform better with shorter text segments, as the semantics are less likely to be over-compressed in the embeddings. Consequently, practitioners often split text documents into smaller chunks and encode them separately. However, chunk embeddings created in this way can lose contextual information from surrounding chunks, resulting in sub-optimal representations. In this paper, we introduce a novel method called late chunking, which leverages long context embedding models to first embed all tokens of the long text, with chunking applied after the transformer model and just before mean pooling - hence the term late in its naming. The resulting chunk embeddings capture the full contextual information, leading to superior results across various retrieval tasks. The method is generic enough to be applied to a wide range of long-context embedding models and works without additional training. To further increase the effectiveness of late chunking, we propose a dedicated fine-tuning approach for embedding models.
arXiv.orgMichael Günther
Late Chunking Poster at Robust-IR@SIGIR 2025
Late_Chunking_Poster.pdf
Google Docs

Download the poster from Google Drive

tagInvestigación interesante

Encontramos una gran cantidad de investigaciones interesantes presentadas en SIGIR, pero el trabajo a continuación nos llamó la atención.

tagCLIP-AdaM: Adaptación de CLIP multivista para la recuperación de objetos 3D de conjunto abierto

Este artículo se centró en la recuperación de imágenes 3D, específicamente la recuperación de objetos 3D de conjunto abierto, que es la tarea de recuperar objetos 3D para categorías de objetos no vistas previamente, sin haber sido entrenados para ellos. Su enfoque utiliza vistas renderizadas de modelos 3D desde múltiples ángulos para reconocer objetos utilizando modelos CLIP entrenados en imágenes planas. Un hallazgo interesante del artículo es que los modelos CLIP funcionan bien al promediar los vectores modelo generados a partir de diferentes vistas del objeto.

Figura 2: Esquema del modelo para CLIP-AdaM

Más allá de eso, el artículo propone un nuevo método de entrenamiento para la recuperación de objetos 3D que aprende a ponderar diferentes vistas, así como capas adaptativas que ajustan el modelo para tareas específicas al tiempo que evitan el sobreajuste en las categorías de datos de entrenamiento y mejoran el rendimiento de disparo cero en nuevas categorías.

tagOptimización de sistemas de recuperación compuestos

La mayoría de los sistemas de clasificación existentes, que combinan varios modelos de clasificación para producir resultados, se basan en cascadas de clasificación. Esto significa que un modelo de clasificación se ejecuta después de otro, y cada uno conserva solo los resultados con la mejor puntuación del anterior.

Este artículo propone un enfoque diferente que denomina sistemas de recuperación compuestos: un marco para combinar diferentes reordenadores para maximizar la precisión de la clasificación y la eficiencia computacional. Los autores proponen entenderlo como una generalización del enfoque de cascada, que ejecuta múltiples reordenadores en diferentes subconjuntos de los resultados de las etapas de clasificación anteriores.

La figura siguiente se da en el artículo para mostrar cómo se pueden combinar diferentes reordenadores.

Figura 3: Esquemas del proceso de reordenamiento multietapa, con la leyenda original.

En su ejemplo, un clasificador de primera etapa produce una clasificación inicial. Luego, la segunda etapa utiliza dos reordenadores con diferentes enfoques de clasificación:

  • Un modelo de clasificación puntual que produce una puntuación de relevancia para los documentos del primer clasificador, basada en una consulta.
  • Un modelo de clasificación por pares que compara dos documentos y la consulta y genera una probabilidad estimada de que uno de los dos sea más relevante para la consulta que el otro.

Cada modelo tiene una política de selección que se aplica a los resultados de la etapa de clasificación anterior; por ejemplo, tomar solo los n mejores. También hay una función de ordenación final que produce el resultado final. Tanto la política de selección como la función de ordenación tienen parámetros establecidos por el entrenamiento, lo que permite una optimización holística que produce resultados mejores y más robustos.

tagRE-AdaptIR: Improving Information Retrieval through Reverse Engineered Adaptation

Se ha investigado mucho el uso de técnicas de álgebra lineal para optimizar los pesos del modelo de vectorización. Por ejemplo, el método de sopa de modelos mejora la precisión y la robustez del modelo al promediar los pesos de los modelos que resultan de ajustar el mismo modelo base con diferentes hiperparámetros.

Figure 4: Poster presentation

La investigación presentada en este artículo ofrece una idea relacionada: ¿Podemos utilizar el vector de diferencias entre los pesos de un modelo de vectorización ajustado y su base no ajustada para transferir el aprendizaje de un modelo a otro? Si ajustamos otra copia del modelo base en la predicción del siguiente token para texto específico del dominio y luego añadimos las diferencias de peso del modelo de vectorización entrenado, ¿obtendremos un mejor modelo de vectorización para el dominio de destino?

Figure 5: Explanatory figure giving a high-level picture of what RE-AdaptIR proposes.

Esto tiene importantes ventajas para el entrenamiento de modelos para nuevos dominios. Permite utilizar abundantes datos de texto plano para entrenar la predicción del siguiente token y, a continuación, disfrutar de una mejora de las vectorizaciones como resultado.

tagBenchmarking LLM-based Relevance Judgment Methods

Este artículo evalúa las estrategias de Prompt para utilizar los LLM como jueces de relevancia, incluyendo su uso para juicios binarios (sí/no), evaluaciones graduadas (es decir, escalas de 0 a 4), comparaciones por pares de documentos para la relevancia y métodos "basados en fragmentos", que deciden si un documento contiene información específica.

Los autores concluyen, a partir de las pruebas con GPT-4o y Llama 3, que los resultados están más alineados con los juicios humanos cuando el LLM tiene menos opciones. Los juicios binarios y las comparaciones por pares funcionan mejor y, con modelos de IA muy potentes, son lo suficientemente buenos para un uso automatizado a gran escala. Un buen diseño de Prompt es un factor crítico.

Los métodos basados en fragmentos permiten la interpretabilidad humana, pero son menos fiables.

tagRankers, Judges, and Assistants: Towards Understanding the Interplay of LLMs in Information Retrieval Evaluation

Este artículo explora cuestiones relacionadas con el uso de LLM en tres funciones distintas: clasificar los resultados, juzgar la relevancia y evaluar los resultados, y funciones de apoyo como la síntesis de resultados y la expansión de consultas.

Considera las consecuencias del uso de LLM en todo el ciclo de la información, como se muestra en la figura siguiente, extraída del artículo.

Figure 6: An illustration of LLM usage in modern IR

El artículo concluye que existen problemas importantes en el uso de juicios basados en LLM para evaluar sistemas de recuperación de información que a su vez se basan en LLM. La interacción de los diferentes componentes basados en LLM puede conducir sin duda a resultados sesgados e inexactos.

tagLLM-Driven Usefulness Labeling for IR Evaluation

Este artículo distingue entre relevancia y utilidad en los resultados de búsqueda. La relevancia, en su definición, se refiere a si el tema de un documento recuperado está relacionado temáticamente con la consulta; la utilidad se refiere a si el documento responde a la consulta, es decir, si cumple la intención del usuario.

Su objetivo es determinar si los LLM pueden reconocer y clasificar la utilidad y si sus juicios se alinean con los humanos. Concluyen que existe una alineación significativa entre los jueces humanos de utilidad y los LLM. Sin embargo, los LLM disponibles tienen dificultades con los casos en los que la relevancia y la utilidad no están alineadas, es decir, los documentos relevantes pero no útiles. Los autores descubren que proporcionar a los LLM más información de contexto, en lugar de solo consultas de texto, mejora significativamente los resultados.

tagLLM-based Relevance Assessment Still Can’t Replace Human Relevance Assessment

El artículo analiza el uso de LLM para la evaluación automática de la relevancia en la recuperación de información, lo que facilitaría mucho el entrenamiento de modelos de recuperación, ya que nunca hay suficientes datos clasificados por humanos. Aunque algunos estudios recientes afirman que los LLM pueden sustituir por completo a los evaluadores humanos, este artículo identifica las limitaciones clave que impiden que los LLM sustituyan al juicio humano.

  • Evidencia insuficiente y generalización limitada de la investigación actual: La investigación actual carece de pruebas sólidas de que los LLM puedan sustituir por completo los juicios de relevancia humanos, especialmente en diversos conjuntos de datos y escenarios del mundo real. Cuando existen resultados positivos, es discutible si realmente se aplican a dominios amplios.
  • Vulnerabilidad a la manipulación: Las métricas automatizadas, incluidas las basadas en LLM, pueden manipularse fácilmente. Es muy fácil mejorar las puntuaciones sin mejorar realmente el rendimiento.
  • Sesgo de autopreferencia: Los LLM tienden a favorecer los resultados similares a sus propios datos de entrenamiento, introduciendo un sesgo que compromete la objetividad de las evaluaciones de relevancia.
  • Riesgos de sobreajuste: Confiar en las evaluaciones basadas en LLM puede hacer que los sistemas de recuperación se optimicen para las idiosincrasias de los LLM específicos, reduciendo el rendimiento en el uso del mundo real.

tagConclusión

El rápido auge de los grandes modelos lingüísticos ha transformado significativamente la recuperación de información, sustituyendo a métodos establecidos como BM25 y abriendo nuevas posibilidades. La investigación mostrada en SIGIR destaca esta transformación.

Sin embargo, los modelos lingüísticos no convierten la recuperación de información en un problema resuelto. La conferencia presentó una amplia gama de ideas innovadoras destinadas a alinear los sistemas de RI más estrechamente con las necesidades cambiantes de los usuarios. Realmente disfrutamos conectando con estudiantes de doctorado y expertos, intercambiando ideas y compartiendo nuestra visión del futuro de la búsqueda en Jina AI. Estamos entusiasmados de seguir superando los límites de lo que es posible en este campo.

Categorías:
Evento
rss_feed

Leer más
agosto 11, 2025 • 8 minutos de lectura
What We Learned at SIGIR 2025
Michael Günther
Bo Wang
Scott Martens
Conference scene in a large auditorium with a "SIGIR 2025" banner on the projected screen, a speaker on stage, and attendees
mayo 25, 2025 • 21 minutos de lectura
What We Learned at ICLR2025
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
noviembre 05, 2024 • 2 minutos de lectura
Call for Participants: EMNLP 2024 BoF on Embeddings, Reranker & Small LMs for Better Search
Jina AI
Event poster for "Embedding Reranker, Small LM & Better Search" on Nov 14, 2024, from 10:30 to 12:00 at Miami Lecture Hall. F
Idioma / tema actual
Search Foundation
Lector
Incrustaciones
reclasificador
Obtener la clave API de Jina
Límite de velocidad
Sobre nosotros
Noticias
Descargar el logotipo de Jina
open_in_new
Descargar el logotipo de Elastic
open_in_new
Estado de la API
Elastic © 2026.SeguridadTérminos y condicionesPrivacidadAdministrar cookiesNo venda ni comparta mi información personal.
Este sitio web y todo su contenido, software, productos y servicios asociados están destinados exclusivamente al uso profesional. No se permite ni se recomienda su uso por parte de consumidores.