SIGIR (Special Interest Group on Information Retrieval) est une conférence de premier plan sur la recherche d'informations, qui rassemble des chercheurs, des développeurs, des experts de l'industrie et des éducateurs du monde entier pour partager les dernières recherches révolutionnaires. Jina AI était présente à la conférence de cette année à Padoue en juillet, présentant notre travail sur le "late chunking" à l'atelier Robust IR.
La conférence de cette année a présenté des recherches étonnantes, en particulier dans les méthodes de réordonnancement, les modèles de recherche clairsemée et l'utilisation de LLM dans la recherche d'informations. Les points forts comprennent les discours de Stephen Robertson sur l'histoire et le développement de l'algorithme de classement BM25 et d'Iryna Gurevych sur les perspectives d'avenir de l'IA dans la recherche scientifique. Les experts et les étudiants en doctorat enthousiastes présents ont suscité de nombreuses discussions animées. La conférence s'est déroulée au Centre des Congrès de Padoue, situé au cœur de la ville. Padoue est un lieu riche en histoire et en culture, et nous avons pleinement profité de notre séjour.
tagLe "Late Chunking" à l'atelier Robust IR
L'atelier Robust IR est un nouvel événement à SIGIR, qui s'est tenu pour la première fois cette année. Il s'est concentré sur la façon dont les systèmes de recherche d'informations fonctionnent dans des situations difficiles et exceptionnelles, et sur la façon dont nous pouvons améliorer leur robustesse. L'atelier était un mélange de conférences invitées et de présentations orales de documents acceptés, ainsi qu'une table ronde.
Nous avons présenté notre travail sur le "late chunking" lors de la session d'affichage de l'atelier. Il y a eu de nombreuses questions et commentaires perspicaces, dont un bon nombre de personnes qui avaient déjà lu notre pré-impression.




Download the poster from Google Drive
tagRecherche intéressante
Nous avons trouvé beaucoup de recherches intéressantes présentées à SIGIR, mais le travail ci-dessous nous a particulièrement intéressés.
tagCLIP-AdaM : Adaptation de CLIP multi-vues pour la récupération d'objets 3D à ensemble ouvert
Cet article s'est concentré sur la récupération d'images 3D, en particulier la récupération d'objets 3D à ensemble ouvert, qui est la tâche de récupération d'objets 3D pour des catégories d'objets jamais vues auparavant, sans avoir été entraîné pour eux. Leur approche utilise des vues rendues de modèles 3D sous plusieurs angles pour reconnaître des objets à l'aide de modèles CLIP entraînés sur des images plates. Une des conclusions intéressantes de l'article est que les modèles CLIP fonctionnent bien lorsqu'on fait la moyenne des vecteurs modèles générés à partir de différentes vues de l'objet.

Au-delà de cela, l'article propose une nouvelle méthode d'apprentissage pour la récupération d'objets 3D qui apprend à pondérer différentes vues, ainsi que des couches adaptatives qui règlent le modèle pour des tâches spécifiques tout en empêchant le surapprentissage sur les catégories de données d'apprentissage et en améliorant les performances zéro-shot sur de nouvelles catégories.
tagOptimisation des systèmes de récupération composés
La plupart des systèmes de classement existants, qui combinent plusieurs modèles de classement pour produire des résultats, sont basés sur des cascades de classement. Cela signifie qu'un modèle de classement est exécuté après l'autre, chacun ne conservant que les résultats les mieux notés du précédent.
Cet article propose une approche différente qu'il appelle systèmes de récupération composés : un cadre pour combiner différents réordonnanceurs afin de maximiser la précision du classement et l'efficacité computationnelle. Les auteurs proposent de le comprendre comme une généralisation de l'approche en cascade, qui exécute plusieurs réordonnanceurs sur différents sous-ensembles des résultats des étapes de classement précédentes.
La figure ci-dessous est donnée dans l'article pour montrer comment différents réordonnanceurs peuvent être combinés.

Dans leur exemple, un classeur de première étape produit un classement initial. Ensuite, la deuxième étape utilise deux réordonnanceurs avec différentes approches de classement :
- Un modèle de classement point par point qui produit un score de pertinence pour les documents du premier classeur, basé sur une requête.
- Un modèle de classement par paire qui compare deux documents et la requête et produit une probabilité estimée que l'un des deux soit plus pertinent pour la requête que l'autre.
Chaque modèle dispose d'une politique de sélection qui est appliquée aux résultats de l'étape de classement précédente, par exemple, ne prendre que les n premiers. Il existe également une fonction d'ordonnancement final qui produit le résultat final. La politique de sélection et la fonction d'ordonnancement ont des paramètres définis par l'apprentissage, ce qui permet une optimisation holistique qui donne des résultats meilleurs et plus robustes.
tagRE-AdaptIR : Amélioration de la recherche d'informations grâce à l'adaptation par rétro-ingénierie
De nombreuses recherches ont été menées sur l'utilisation de techniques d'algèbre linéaire pour optimiser les poids des modèles de vecteurs modèles. Par exemple, la méthode de la soupe de modèles améliore la précision et la robustesse du modèle en faisant la moyenne des poids des modèles qui résultent du réglage fin du même modèle de base avec différents hyperparamètres.

La recherche présentée dans cet article propose une idée connexe : pouvons-nous utiliser le vecteur des différences entre les poids d'un modèle de vecteurs modèles affiné et sa base non affinée pour transférer l'apprentissage d'un modèle à un autre ? Si nous affinons une autre copie du modèle de base sur la prédiction du prochain jeton pour un texte spécifique au domaine, puis que nous ajoutons les différences de poids du modèle de vecteurs modèles entraîné, obtiendrons-nous un meilleur modèle de vecteurs modèles pour le domaine cible ?

Ceci présente des avantages importants pour la formation de modèles pour de nouveaux domaines. Il permet d'utiliser de nombreuses données en texte brut pour s'entraîner à la prédiction du jeton suivant, et de bénéficier ainsi d'embeddings améliorés.
tagÉvaluation comparative des méthodes de jugement de pertinence basées sur les LLM
Cet article évalue les stratégies de Prompt pour l'utilisation des LLM comme juges de pertinence, notamment en les utilisant pour des jugements binaires (oui/non), des évaluations graduées (c'est-à-dire des échelles de 0 à 4), des comparaisons par paires de documents pour la pertinence et des méthodes "basées sur les pépites", qui décident si un document contient des informations spécifiques.
Les auteurs concluent, à partir de tests avec GPT-4o et Llama 3, que les résultats sont plus conformes aux jugements humains lorsque le LLM a moins de choix. Les jugements binaires et les comparaisons par paires sont les plus performants et, avec des modèles d'IA très puissants, ils sont suffisamment bons pour une utilisation automatisée à grande échelle. Une bonne conception de Prompt est un facteur essentiel.
Les méthodes basées sur les pépites permettent l'interprétabilité humaine, mais sont moins fiables.
tagClasseurs, juges et assistants : Vers la compréhension de l'interaction des LLM dans l'évaluation de la recherche d'informations
Cet article explore les problèmes liés à l'utilisation des LLM dans trois rôles distincts : le classement des résultats, le jugement de la pertinence et l'évaluation des résultats, et les fonctions de soutien telles que la synthèse des résultats et l'expansion des requêtes.
Il examine les conséquences de l'utilisation des LLM sur l'ensemble du cycle de l'information, comme le montre la figure ci-dessous, tirée de l'article.

L'article conclut qu'il existe des problèmes importants liés à l'utilisation de jugements basés sur les LLM dans l'évaluation des systèmes de recherche d'informations qui reposent eux-mêmes sur les LLM. L'interaction des différentes composantes basées sur les LLM peut certainement conduire à des résultats biaisés et inexacts.
tagÉtiquetage de l'utilité basée sur les LLM pour l'évaluation de l'IR
Cet article fait une distinction entre la pertinence et l'utilité dans les résultats de recherche. La pertinence, dans leur définition, concerne la question de savoir si le sujet d'un document récupéré est lié au sujet de la requête ; l'utilité concerne la question de savoir si le document répond à la requête, c'est-à-dire s'il satisfait à l'intention de l'utilisateur.
Il se concentre sur la question de savoir si les LLM peuvent reconnaître et classer l'utilité et si leurs jugements correspondent à ceux des humains. Ils concluent qu'il existe un alignement significatif entre les juges humains de l'utilité et les LLM. Cependant, les LLM disponibles ont du mal avec les cas où la pertinence et l'utilité ne sont pas alignées, c'est-à-dire les documents pertinents mais pas utiles. Les auteurs constatent que le fait de donner aux LLM plus d'informations contextuelles, au lieu de simples requêtes textuelles, améliore considérablement les résultats.
tagL'évaluation de la pertinence basée sur les LLM ne peut toujours pas remplacer l'évaluation de la pertinence humaine
L'article traite de l'utilisation des LLM pour l'évaluation automatique de la pertinence dans la recherche d'informations, ce qui faciliterait grandement l'entraînement des modèles de recherche, car il n'y a jamais assez de données classées par des humains. Bien que certaines études récentes affirment que les LLM peuvent entièrement remplacer les évaluateurs humains, cet article identifie les principales limitations qui empêchent les LLM de se substituer au jugement humain.
- Preuves insuffisantes et généralisation limitée des recherches actuelles : Les recherches actuelles ne fournissent pas de preuves solides que les LLM peuvent entièrement remplacer les jugements de pertinence humains, en particulier sur divers ensembles de données et dans des scénarios réels. Lorsqu'il existe des résultats positifs, il est discutable de savoir s'ils s'appliquent réellement à de vastes domaines.
- Vulnérabilité à la manipulation : Les métriques automatisées, y compris celles basées sur les LLM, peuvent être facilement manipulées. Il est très facile d'améliorer les scores sans réellement améliorer les performances.
- Biais d'auto-préférence : Les LLM ont tendance à favoriser les résultats similaires à leurs propres données d'entraînement, ce qui introduit un biais qui compromet l'objectivité des évaluations de pertinence.
- Risques de surapprentissage : Le fait de s'appuyer sur des évaluations basées sur les LLM peut amener les systèmes de recherche à s'optimiser pour les particularités de LLM spécifiques, ce qui réduit les performances dans l'utilisation réelle.
tagConclusion
L'essor rapide des grands modèles linguistiques a considérablement transformé la recherche d'informations, remplaçant les méthodes établies comme BM25 et ouvrant de nouvelles possibilités. La recherche présentée à SIGIR met en évidence cette transformation.
Cependant, les modèles linguistiques ne font pas de la recherche d'informations un problème résolu. La conférence a présenté un large éventail d'idées novatrices visant à aligner plus étroitement les systèmes d'IR sur les besoins évolutifs des utilisateurs. Nous avons vraiment apprécié de rencontrer des doctorants et des experts, d'échanger des idées et de partager notre vision de l'avenir de la recherche chez Jina AI. Nous sommes ravis de continuer à repousser les limites de ce qui est possible dans ce domaine.










