La Conférence Internationale sur l'Apprentissage Automatique est l'une des conférences les plus prestigieuses de la communauté de l'apprentissage automatique et de l'intelligence artificielle, et a tenu sa réunion 2024 à Vienne du 21 au 27 juillet cette année.

La conférence a été une expérience d'apprentissage intensive de 7 jours, avec des présentations orales et des opportunités d'échanger des idées directement avec d'autres chercheurs. Il y a beaucoup de travaux intéressants en cours dans l'apprentissage par renforcement, l'IA pour les sciences de la vie, l'apprentissage des représentations, les modèles multimodaux, et bien sûr dans les éléments fondamentaux du développement des modèles d'IA. Le tutoriel sur la Physique des Grands Modèles de Langage était particulièrement important, explorant en profondeur le fonctionnement interne des LLM et offrant des réponses convaincantes à la question de savoir si les LLM mémorisent l'information ou appliquent un raisonnement lorsqu'ils s'expriment.
tagNotre travail sur Jina-CLIP-v1
Nous avons fait une présentation par poster de notre travail sur notre nouveau modèle multimodal jina-clip-v1 dans le cadre de l'atelier Multi-modal Foundation Models meet Embodied AI.

La rencontre et la discussion de notre travail avec des collègues internationaux travaillant dans de nombreux domaines ont été très inspirantes. Notre présentation a reçu beaucoup de retours positifs, avec de nombreuses personnes intéressées par la façon dont Jina CLIP unifie les paradigmes d'apprentissage contrastif multimodal et unimodal. Les discussions ont porté sur les limites de l'architecture CLIP jusqu'aux extensions à d'autres modalités et aux applications dans l'appariement des peptides et des protéines.
[Video section preserved as is]tagNos Favoris
Nous avons eu l'opportunité de discuter de nombreux projets et présentations d'autres chercheurs, et voici quelques-uns de nos favoris :
tagPlan Like a Graph (PLaG)
Beaucoup connaissent le « Few-Shot Prompting » ou le « Chain of Thought prompting ». Fangru Lin a présenté une nouvelle méthode plus efficace à l'ICML : Plan Like a Graph (PLaG).
Son idée est simple : une tâche donnée à un LLM est décomposée en sous-tâches que le LLM peut résoudre soit en parallèle, soit séquentiellement. Ces sous-tâches forment un graphe d'exécution. L'exécution du graphe complet résout la tâche de haut niveau.
Dans la vidéo ci-dessus, Fangru Lin explique la méthode à l'aide d'un exemple facilement compréhensible. Notez que même si cela améliore vos résultats, les LLM souffrent toujours d'une dégradation drastique lorsque la complexité des tâches augmente. Cela dit, c'est tout de même un grand pas dans la bonne direction qui apporte des avantages pratiques immédiats.
Pour nous, il est intéressant de voir comment son travail fait écho à nos applications de prompts chez Jina AI. Nous avons déjà implémenté une structure de prompt similaire à un graphe, cependant, la génération dynamique d'un graphe d'exécution comme elle l'a fait est une nouvelle direction que nous explorerons.
tagDécouverte d'environnements avec XRM
Cet article présente un algorithme simple pour découvrir des environnements d'entraînement qui peuvent amener un modèle à s'appuyer sur des caractéristiques qui corrèlent avec les étiquettes mais n'induisent pas une classification/pertinence précise. Un exemple célèbre est le jeu de données waterbirds (voir arXiv:1911.08731), qui contient des photos d'oiseaux sur différents arrière-plans qui doivent être classés comme oiseaux aquatiques ou terrestres. Pendant l'entraînement, le classificateur détecte si l'arrière-plan des images montre de l'eau ou non au lieu de s'appuyer sur les caractéristiques des oiseaux eux-mêmes. Un tel modèle va mal classer les oiseaux aquatiques s'il n'y a pas d'eau en arrière-plan.
Pour atténuer ce comportement, il faut détecter les échantillons où le modèle s'appuie sur des caractéristiques d'arrière-plan trompeuses. Cet article présente l'algorithme XRM pour faire cela.
L'algorithme entraîne deux modèles sur deux parties distinctes du jeu de données d'entraînement. Pendant l'entraînement, les étiquettes de certains échantillons sont inversées. Plus précisément, cela se produit si l'autre modèle (qui n'est pas entraîné sur l'échantillon en question) classifie un échantillon différemment. De cette façon, les modèles sont encouragés à s'appuyer sur des corrélations fallacieuses. Ensuite, vous pouvez extraire des échantillons des données d'entraînement où une étiquette prédite par l'un des modèles diffère de la vérité terrain. Par la suite, on peut utiliser cette information pour entraîner des modèles de classification plus robustes, par exemple avec l'algorithme Group DRO.
tagRéduisez vos coûts d'évaluation LLM d'un facteur 140 !
Oui, vous avez bien entendu. Avec cette astuce, le coût d'évaluation des LLM peut être réduit à une infime fraction.
L'idée principale est simple : Supprimez tous les échantillons d'évaluation qui testent la même capacité du modèle. Les mathématiques derrière sont moins évidentes mais bien expliquées par Felipe Maia Polo qui a présenté son travail lors de la session poster. Notez que la réduction d'un facteur 140 s'applique au populaire jeu de données MMLU (Massive Multitask Language Understanding). Pour vos propres jeux de données d'évaluation, cela dépend du degré de corrélation entre les résultats d'évaluation des échantillons. Vous pourrez peut-être ignorer de nombreux échantillons ou seulement quelques-uns.
Essayez simplement. Nous vous tiendrons informés de la réduction d'échantillons d'évaluation que nous aurons pu réaliser chez Jina AI.
tagContraster des représentations multiples avec le Multi-Marginal Matching Gap

Ce travail aborde un défi courant dans l'apprentissage contrastif : La plupart des fonctions de perte contrastive comme la perte InfoNCE opèrent sur des paires de points de données et mesurent la distance entre les paires positives. Pour étendre aux tuples positifs de taille k > 2, l'apprentissage contrastif essaie généralement de réduire le problème à plusieurs paires et d'accumuler les pertes par paires pour toutes les paires positives. Les auteurs proposent ici la perte M3G (Multi-Marginal Matching Gap), une version modifiée de l'algorithme de Sinkhorn, qui résout le problème du Transport Optimal Multi-Marginal. Cette fonction de perte peut être utilisée dans des scénarios où les jeux de données consistent en tuples positifs de taille k > 2, par exemple, >2 images du même objet, des problèmes multi-modaux avec trois modalités ou plus, ou une extension SimCLR avec trois augmentations ou plus de la même image. Les résultats empiriques montrent que cette méthode surpasse la réduction naïve du problème aux paires.
tagPas besoin de vérité terrain !
Zachary Robertson de Stanford University a présenté son travail sur l'évaluation des LLM sans données étiquetées. Notez que même s'il s'agit d'un travail théorique, il a beaucoup de potentiel pour la surveillance à grande échelle des systèmes d'IA avancés. Ce n'est pas pour les utilisateurs occasionnels de LLM, mais si vous travaillez sur l'évaluation des LLM, c'est définitivement quelque chose à explorer. Nous voyons déjà que nous pourrions évaluer nos agents chez Jina AI de cette manière. Nous partagerons les résultats une fois que nous aurons effectué les premières expériences.
tagL'effondrement du modèle est-il inévitable ? Briser la malédiction de la récursion en accumulant des données réelles et synthétiques

Plusieurs articles (comme cet article de Nature) ont récemment prédit que les performances des nouveaux modèles entraînés pourraient se dégrader avec le temps car les données d'entraînement issues du web contiennent une quantité croissante de données synthétiques.
Notre collègue Scott Martens a également publié un article sur l'effondrement des modèles et a discuté des cas où les données synthétiques peuvent être utiles pour l'entraînement des modèles.

Les entraînements des modèles pourraient s'effondrer car les données d'entraînement sont produites par une version antérieure du modèle ou un modèle entraîné sur les mêmes données. Cette étude présente des expériences qui montrent une image légèrement différente : un effondrement ne se produit que lors du remplacement des données réelles par des données synthétiques, ce qui était le cas dans les expériences précédentes. Cependant, lors de l'augmentation des données réelles avec des données synthétiques supplémentaires, aucun changement dans les performances des modèles résultants n'a été mesuré. Ces résultats suggèrent qu'un effondrement des modèles ne se produira pas. Toutefois, cela prouve à nouveau que l'utilisation de données synthétiques supplémentaires n'aidera pas à entraîner un modèle généralement supérieur au modèle utilisé pour créer ces points de données synthétiques.
tagLa Chirurgie Cérébrale pour l'IA est Maintenant Possible
Disons que vous voulez prédire la profession de quelqu'un mais pas son genre. Ce travail de Google Research, ETH Zürich, International Institute of Information Technology Hyderabad (IIITH), et Bar-Ilan University montre comment les vecteurs de direction et l'appariement de covariance peuvent être utilisés pour contrôler les biais.
tagMagicLens - Recherche d'Images Auto-Supervisée avec Instructions Ouvertes

Cet article présente les modèles MagicLens, une série de modèles de recherche d'images auto-supervisés entraînés sur des triplets image de requête + instruction + image cible.
Les auteurs présentent un pipeline de collecte/curation de données qui recueille des paires d'images du web et utilise des LLMs pour synthétiser des instructions textuelles ouvertes qui relient les images avec diverses relations sémantiques au-delà de la simple similarité visuelle. Ce pipeline est utilisé pour produire 36,7M de triplets de haute qualité sur une large distribution. Le jeu de données est ensuite utilisé pour entraîner une architecture simple à double encodeur avec des paramètres partagés. Les encodeurs de vision et de langage sont initialisés avec soit CoCa soit des variantes CLIP base et large. Un pooler d'attention multi-têtes unique est introduit pour compresser les deux entrées multimodales en un seul embedding. L'objectif d'entraînement compare la paire image-requête et instruction avec l'image cible et l'instruction vide avec une simple perte InfoNCE pour entraîner MagicLens. Les auteurs présentent des résultats d'évaluation sur la recherche d'images basée sur les instructions.
tagPrompt Sketching - La Nouvelle Façon de Prompting
La façon dont nous interrogeons les LLMs évolue. Le Prompt Sketching nous permet de donner des contraintes fixes aux modèles génératifs. Au lieu de simplement fournir une instruction en espérant que le modèle fera ce que vous voulez, vous définissez un modèle complet, forçant le modèle à générer ce que vous souhaitez.
Ne confondez pas cela avec les LLMs fine-tunés pour fournir un format JSON structuré. Avec l'approche du fine-tuning, le modèle a toujours la liberté de générer ce qu'il veut. Ce n'est pas le cas avec le Prompt Sketching. Il fournit une boîte à outils complètement nouvelle pour les ingénieurs prompt et ouvre des domaines de recherche qui doivent être explorés. Dans la vidéo ci-dessus, Mark Müller explique en détail ce qu'est ce nouveau paradigme.
Vous pouvez également consulter leur projet open-source LMQL.
tagRepoformer - Récupération Sélective pour la Complétion de Code au Niveau du Dépôt
Pour de nombreuses requêtes, le RAG n'aide pas vraiment le modèle car la requête est soit trop simple, soit le système de récupération ne peut pas trouver de documents pertinents, possiblement parce qu'il n'y en a pas. Cela conduit à des temps de génération plus longs et des performances plus faibles si le modèle s'appuie sur des sources trompeuses ou absentes.
Cet article aborde le problème en permettant aux LLMs d'auto-évaluer si la récupération est utile. Ils démontrent cette approche sur un modèle de complétion de code qui est entraîné à remplir un vide dans un modèle de code. Pour un modèle donné, le système décide d'abord si les résultats de la récupération sont utiles et, si oui, fait appel au récupérateur. Enfin, le LLM de code génère le contexte manquant que les résultats de la récupération soient ajoutés ou non à son prompt.
tagL'Hypothèse de la Représentation Platonicienne

L'Hypothèse de la Représentation Platonicienne soutient que les réseaux de neurones artificiels auront tendance à converger vers une représentation commune du monde. S'inspirant de la Théorie des Formes de Platon, l'idée qu'il existe un royaume d'"idéaux", qui nous apparaît sous une forme déformée que nous ne pouvons observer qu'indirectement, les auteurs affirment que nos modèles d'IA semblent converger vers une représentation unique de la réalité, indépendamment de l'architecture d'entraînement, des données d'entraînement, ou même de la modalité d'entrée. Plus l'échelle des données et la taille du modèle sont importantes, plus leurs représentations semblent devenir similaires.
Les auteurs considèrent les représentations vectorielles et mesurent l'alignement des représentations en utilisant des métriques d'alignement de noyaux, en particulier une métrique des plus proches voisins mutuels qui mesure l'intersection moyenne des ensembles de k-plus proches voisins induits par deux noyaux, K1 et K2, normalisée par k. Ce travail présente des preuves empiriques montrant qu'à mesure que la taille des modèles et des jeux de données augmente et que les performances s'améliorent, les noyaux deviennent plus alignés. Cet alignement peut également être observé même lors de la comparaison de modèles de différentes modalités, comme les modèles de texte et les modèles d'images.
tagRésumé
Une partie de l'enthousiasme initial suscité par la loi d'échelle commence à s'estomper, mais ICML 2024 a démontré que tant de nouveaux talents, divers et créatifs, sont entrés dans notre domaine que nous pouvons être sûrs que le progrès est loin d'être terminé.
Nous avons passé un excellent moment à ICML 2024 et vous pouvez être sûrs que nous serons de retour en 2025 🇨🇦.









