Elastic
Jina AI
Modèles
API
keyboard_arrow_down
Reader
Convertissez n'importe quelle URL en Markdown pour un meilleur grounding des LLM.
Embeddings
Embeddings multimodales et multilingues.
Reclasseur
Outil de reclassement pour optimiser la pertinence des résultats de recherche.
MCP
terminal
CLI
article
llms.txt
smart_toy
Agents
data_object
Schéma
menu_book
Documents
Se connecter
login
Notre travail sur Jina-CLIP-v1
Nos Favoris
Résumé
Événement
août 07, 2024

Ce que nous avons appris à ICML2024 avec PLaG, XRM, tinyBenchmark, MagicLens, Prompt Sketching etc.

Nous avons passé des moments incroyables à l'ICML 2024 à Vienne, et nous souhaitons partager avec vous tout ce que nous avons dit, vu et appris.
Two logos on gray background: upper "ICML International Conference on Machine Learning," lower abstract "vibo" logo.
Florian Hönicke, Michael Günther, Georgios Mastrapas, Scott Martens • 10 minutes lues

La Conférence Internationale sur l'Apprentissage Automatique est l'une des conférences les plus prestigieuses de la communauté de l'apprentissage automatique et de l'intelligence artificielle, et a tenu sa réunion 2024 à Vienne du 21 au 27 juillet cette année.

Intérieur d'une salle de conférence académique animée avec de nombreux participants, certains portant des sacs à dos, et des posters de recherche affichés

La conférence a été une expérience d'apprentissage intensive de 7 jours, avec des présentations orales et des opportunités d'échanger des idées directement avec d'autres chercheurs. Il y a beaucoup de travaux intéressants en cours dans l'apprentissage par renforcement, l'IA pour les sciences de la vie, l'apprentissage des représentations, les modèles multimodaux, et bien sûr dans les éléments fondamentaux du développement des modèles d'IA. Le tutoriel sur la Physique des Grands Modèles de Langage était particulièrement important, explorant en profondeur le fonctionnement interne des LLM et offrant des réponses convaincantes à la question de savoir si les LLM mémorisent l'information ou appliquent un raisonnement lorsqu'ils s'expriment.

tagNotre travail sur Jina-CLIP-v1

Nous avons fait une présentation par poster de notre travail sur notre nouveau modèle multimodal jina-clip-v1 dans le cadre de l'atelier Multi-modal Foundation Models meet Embodied AI.

Jina CLIP: Your CLIP Model Is Also Your Text Retriever
Contrastive Language-Image Pretraining (CLIP) is widely used to train models to align images and texts in a common embedding space by mapping them to fixed-sized vectors. These models are key to multimodal information retrieval and related tasks. However, CLIP models generally underperform in text-only tasks compared to specialized text models. This creates inefficiencies for information retrieval systems that keep separate embeddings and models for text-only and multimodal tasks. We propose a novel, multi-task contrastive training method to address this issue, which we use to train the jina-clip-v1 model to achieve the state-of-the-art performance on both text-image and text-text retrieval tasks.
arXiv.orgAndreas Koukounas

La rencontre et la discussion de notre travail avec des collègues internationaux travaillant dans de nombreux domaines ont été très inspirantes. Notre présentation a reçu beaucoup de retours positifs, avec de nombreuses personnes intéressées par la façon dont Jina CLIP unifie les paradigmes d'apprentissage contrastif multimodal et unimodal. Les discussions ont porté sur les limites de l'architecture CLIP jusqu'aux extensions à d'autres modalités et aux applications dans l'appariement des peptides et des protéines.

[Video section preserved as is]

tagNos Favoris

Nous avons eu l'opportunité de discuter de nombreux projets et présentations d'autres chercheurs, et voici quelques-uns de nos favoris :

tagPlan Like a Graph (PLaG)

Lin, F., La Malfa, E., Hofmann, V., Yang, E. M., Cohn, A., & Pierrehumbert, J. B. (2024). Graph-Enhanced Large Language Models in Asynchronous Plan Reasoning. arXiv:2402.02805

Beaucoup connaissent le « Few-Shot Prompting » ou le « Chain of Thought prompting ». Fangru Lin a présenté une nouvelle méthode plus efficace à l'ICML : Plan Like a Graph (PLaG).

Son idée est simple : une tâche donnée à un LLM est décomposée en sous-tâches que le LLM peut résoudre soit en parallèle, soit séquentiellement. Ces sous-tâches forment un graphe d'exécution. L'exécution du graphe complet résout la tâche de haut niveau.

Dans la vidéo ci-dessus, Fangru Lin explique la méthode à l'aide d'un exemple facilement compréhensible. Notez que même si cela améliore vos résultats, les LLM souffrent toujours d'une dégradation drastique lorsque la complexité des tâches augmente. Cela dit, c'est tout de même un grand pas dans la bonne direction qui apporte des avantages pratiques immédiats.

Pour nous, il est intéressant de voir comment son travail fait écho à nos applications de prompts chez Jina AI. Nous avons déjà implémenté une structure de prompt similaire à un graphe, cependant, la génération dynamique d'un graphe d'exécution comme elle l'a fait est une nouvelle direction que nous explorerons.

tagDécouverte d'environnements avec XRM

Pezeshki, M., Bouchacourt, D., Ibrahim, M., Ballas, N., Vincent, P., & Lopez-Paz, D. (2024). Discovering Environments with XRM. arXiv:2309.16748

Cet article présente un algorithme simple pour découvrir des environnements d'entraînement qui peuvent amener un modèle à s'appuyer sur des caractéristiques qui corrèlent avec les étiquettes mais n'induisent pas une classification/pertinence précise. Un exemple célèbre est le jeu de données waterbirds (voir arXiv:1911.08731), qui contient des photos d'oiseaux sur différents arrière-plans qui doivent être classés comme oiseaux aquatiques ou terrestres. Pendant l'entraînement, le classificateur détecte si l'arrière-plan des images montre de l'eau ou non au lieu de s'appuyer sur les caractéristiques des oiseaux eux-mêmes. Un tel modèle va mal classer les oiseaux aquatiques s'il n'y a pas d'eau en arrière-plan.

Pour atténuer ce comportement, il faut détecter les échantillons où le modèle s'appuie sur des caractéristiques d'arrière-plan trompeuses. Cet article présente l'algorithme XRM pour faire cela.

L'algorithme entraîne deux modèles sur deux parties distinctes du jeu de données d'entraînement. Pendant l'entraînement, les étiquettes de certains échantillons sont inversées. Plus précisément, cela se produit si l'autre modèle (qui n'est pas entraîné sur l'échantillon en question) classifie un échantillon différemment. De cette façon, les modèles sont encouragés à s'appuyer sur des corrélations fallacieuses. Ensuite, vous pouvez extraire des échantillons des données d'entraînement où une étiquette prédite par l'un des modèles diffère de la vérité terrain. Par la suite, on peut utiliser cette information pour entraîner des modèles de classification plus robustes, par exemple avec l'algorithme Group DRO.

tagRéduisez vos coûts d'évaluation LLM d'un facteur 140 !

Maia Polo, F., Weber, L., Choshen, L., Sun, Y., Xu, G., & Yurochkin, M. (2024). tinyBenchmarks: evaluating LLMs with Fewer Examples. arXiv:2402.14992

Oui, vous avez bien entendu. Avec cette astuce, le coût d'évaluation des LLM peut être réduit à une infime fraction.

L'idée principale est simple : Supprimez tous les échantillons d'évaluation qui testent la même capacité du modèle. Les mathématiques derrière sont moins évidentes mais bien expliquées par Felipe Maia Polo qui a présenté son travail lors de la session poster. Notez que la réduction d'un facteur 140 s'applique au populaire jeu de données MMLU (Massive Multitask Language Understanding). Pour vos propres jeux de données d'évaluation, cela dépend du degré de corrélation entre les résultats d'évaluation des échantillons. Vous pourrez peut-être ignorer de nombreux échantillons ou seulement quelques-uns.

Essayez simplement. Nous vous tiendrons informés de la réduction d'échantillons d'évaluation que nous aurons pu réaliser chez Jina AI.

tagContraster des représentations multiples avec le Multi-Marginal Matching Gap

Piran, Z., Klein, M., Thornton, J., & Cuturi, M. (2024). Contrasting Multiple Representations with the Multi-Marginal Matching Gap. arXiv:2405.19532
Diagramme de document de recherche illustrant les concepts du Multi-Marginal Matching Gap, avec des titres, des descriptions et des organigrammes en bleu

Ce travail aborde un défi courant dans l'apprentissage contrastif : La plupart des fonctions de perte contrastive comme la perte InfoNCE opèrent sur des paires de points de données et mesurent la distance entre les paires positives. Pour étendre aux tuples positifs de taille k > 2, l'apprentissage contrastif essaie généralement de réduire le problème à plusieurs paires et d'accumuler les pertes par paires pour toutes les paires positives. Les auteurs proposent ici la perte M3G (Multi-Marginal Matching Gap), une version modifiée de l'algorithme de Sinkhorn, qui résout le problème du Transport Optimal Multi-Marginal. Cette fonction de perte peut être utilisée dans des scénarios où les jeux de données consistent en tuples positifs de taille k > 2, par exemple, >2 images du même objet, des problèmes multi-modaux avec trois modalités ou plus, ou une extension SimCLR avec trois augmentations ou plus de la même image. Les résultats empiriques montrent que cette méthode surpasse la réduction naïve du problème aux paires.

tagPas besoin de vérité terrain !

Robertson, Z., Cha, H., Sheha, A., & Koyejo, S. (2024). Implementability of Information Elicitation Mechanisms with Pre-Trained Language Models. In ICML 2024 Workshop on Theoretical Foundations of Foundation Models. URL https://openreview.net/forum?id=QqMnRGlRJk

Zachary Robertson de Stanford University a présenté son travail sur l'évaluation des LLM sans données étiquetées. Notez que même s'il s'agit d'un travail théorique, il a beaucoup de potentiel pour la surveillance à grande échelle des systèmes d'IA avancés. Ce n'est pas pour les utilisateurs occasionnels de LLM, mais si vous travaillez sur l'évaluation des LLM, c'est définitivement quelque chose à explorer. Nous voyons déjà que nous pourrions évaluer nos agents chez Jina AI de cette manière. Nous partagerons les résultats une fois que nous aurons effectué les premières expériences.

tagL'effondrement du modèle est-il inévitable ? Briser la malédiction de la récursion en accumulant des données réelles et synthétiques

Gerstgrasser, M., Schaeffer, R., Dey, A., Rafailov, R., Sleight, H., Hughes, J., Korbak, T., Agrawal, R., Pai, D., Gromov, A., Roberts, D. A., Yang, D., Donoho, D. L., & Koyejo, S. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413
Illustration de deux processus de données d'apprentissage automatique : "Remplacer les données" et "Accumuler les données", avec des organigrammes détaillés et un modèle

Plusieurs articles (comme cet article de Nature) ont récemment prédit que les performances des nouveaux modèles entraînés pourraient se dégrader avec le temps car les données d'entraînement issues du web contiennent une quantité croissante de données synthétiques.

Notre collègue Scott Martens a également publié un article sur l'effondrement des modèles et a discuté des cas où les données synthétiques peuvent être utiles pour l'entraînement des modèles.

When AI Makes AI: Synthetic Data, Model Distillation, And Model Collapse
AI creating AI! Is it the end of the world? Or just another tool to make models do value-adding work? Let's find out!

Les entraînements des modèles pourraient s'effondrer car les données d'entraînement sont produites par une version antérieure du modèle ou un modèle entraîné sur les mêmes données. Cette étude présente des expériences qui montrent une image légèrement différente : un effondrement ne se produit que lors du remplacement des données réelles par des données synthétiques, ce qui était le cas dans les expériences précédentes. Cependant, lors de l'augmentation des données réelles avec des données synthétiques supplémentaires, aucun changement dans les performances des modèles résultants n'a été mesuré. Ces résultats suggèrent qu'un effondrement des modèles ne se produira pas. Toutefois, cela prouve à nouveau que l'utilisation de données synthétiques supplémentaires n'aidera pas à entraîner un modèle généralement supérieur au modèle utilisé pour créer ces points de données synthétiques.

tagLa Chirurgie Cérébrale pour l'IA est Maintenant Possible

Singh, S., Ravfogel, S., Herzig, J., Aharoni, R., Cotterell, R., & Kumaraguru, P. (2024). Representation Surgery: Theory and Practice of Affine Steering. arXiv:2402.09631

Disons que vous voulez prédire la profession de quelqu'un mais pas son genre. Ce travail de Google Research, ETH Zürich, International Institute of Information Technology Hyderabad (IIITH), et Bar-Ilan University montre comment les vecteurs de direction et l'appariement de covariance peuvent être utilisés pour contrôler les biais.

tagMagicLens - Recherche d'Images Auto-Supervisée avec Instructions Ouvertes

Zhang, K., Luan, Y., Hu, H., Lee, K., Qiao, S., Chen, W., Su, Y., & Chang, M.-W. (2024). MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions. arXiv:2403.19651
Interactive slide showing MagicLens tool for visually guided navigation with tasks like identifying buildings and comparing h

Cet article présente les modèles MagicLens, une série de modèles de recherche d'images auto-supervisés entraînés sur des triplets image de requête + instruction + image cible.

Les auteurs présentent un pipeline de collecte/curation de données qui recueille des paires d'images du web et utilise des LLMs pour synthétiser des instructions textuelles ouvertes qui relient les images avec diverses relations sémantiques au-delà de la simple similarité visuelle. Ce pipeline est utilisé pour produire 36,7M de triplets de haute qualité sur une large distribution. Le jeu de données est ensuite utilisé pour entraîner une architecture simple à double encodeur avec des paramètres partagés. Les encodeurs de vision et de langage sont initialisés avec soit CoCa soit des variantes CLIP base et large. Un pooler d'attention multi-têtes unique est introduit pour compresser les deux entrées multimodales en un seul embedding. L'objectif d'entraînement compare la paire image-requête et instruction avec l'image cible et l'instruction vide avec une simple perte InfoNCE pour entraîner MagicLens. Les auteurs présentent des résultats d'évaluation sur la recherche d'images basée sur les instructions.

tagPrompt Sketching - La Nouvelle Façon de Prompting

Beurer-Kellner, L., Müller, M. N., Fischer, M., & Vechev, M. (2023). Prompt Sketching for Large Language Models. arXiv:2311.04954

La façon dont nous interrogeons les LLMs évolue. Le Prompt Sketching nous permet de donner des contraintes fixes aux modèles génératifs. Au lieu de simplement fournir une instruction en espérant que le modèle fera ce que vous voulez, vous définissez un modèle complet, forçant le modèle à générer ce que vous souhaitez.

Ne confondez pas cela avec les LLMs fine-tunés pour fournir un format JSON structuré. Avec l'approche du fine-tuning, le modèle a toujours la liberté de générer ce qu'il veut. Ce n'est pas le cas avec le Prompt Sketching. Il fournit une boîte à outils complètement nouvelle pour les ingénieurs prompt et ouvre des domaines de recherche qui doivent être explorés. Dans la vidéo ci-dessus, Mark Müller explique en détail ce qu'est ce nouveau paradigme.

Vous pouvez également consulter leur projet open-source LMQL.

tagRepoformer - Récupération Sélective pour la Complétion de Code au Niveau du Dépôt

Wu, D., Ahmad, W. U., Zhang, D., Ramanathan, M. K., & Ma, X. (2024). Repoformer: Selective Retrieval for Repository-Level Code Completion. arXiv:2403.10059

Pour de nombreuses requêtes, le RAG n'aide pas vraiment le modèle car la requête est soit trop simple, soit le système de récupération ne peut pas trouver de documents pertinents, possiblement parce qu'il n'y en a pas. Cela conduit à des temps de génération plus longs et des performances plus faibles si le modèle s'appuie sur des sources trompeuses ou absentes.

Cet article aborde le problème en permettant aux LLMs d'auto-évaluer si la récupération est utile. Ils démontrent cette approche sur un modèle de complétion de code qui est entraîné à remplir un vide dans un modèle de code. Pour un modèle donné, le système décide d'abord si les résultats de la récupération sont utiles et, si oui, fait appel au récupérateur. Enfin, le LLM de code génère le contexte manquant que les résultats de la récupération soient ajoutés ou non à son prompt.

tagL'Hypothèse de la Représentation Platonicienne

Huh, M., Cheung, B., Wang, T., & Isola, P. (2024). The Platonic Representation Hypothesis. arXiv:2405.07987
Illustration de "L'Hypothèse de la Représentation Platonicienne" avec des formes géométriques, du texte mathématique et des diagrammes expliquant une

L'Hypothèse de la Représentation Platonicienne soutient que les réseaux de neurones artificiels auront tendance à converger vers une représentation commune du monde. S'inspirant de la Théorie des Formes de Platon, l'idée qu'il existe un royaume d'"idéaux", qui nous apparaît sous une forme déformée que nous ne pouvons observer qu'indirectement, les auteurs affirment que nos modèles d'IA semblent converger vers une représentation unique de la réalité, indépendamment de l'architecture d'entraînement, des données d'entraînement, ou même de la modalité d'entrée. Plus l'échelle des données et la taille du modèle sont importantes, plus leurs représentations semblent devenir similaires.

Les auteurs considèrent les représentations vectorielles et mesurent l'alignement des représentations en utilisant des métriques d'alignement de noyaux, en particulier une métrique des plus proches voisins mutuels qui mesure l'intersection moyenne des ensembles de k-plus proches voisins induits par deux noyaux, K1 et K2, normalisée par k. Ce travail présente des preuves empiriques montrant qu'à mesure que la taille des modèles et des jeux de données augmente et que les performances s'améliorent, les noyaux deviennent plus alignés. Cet alignement peut également être observé même lors de la comparaison de modèles de différentes modalités, comme les modèles de texte et les modèles d'images.

tagRésumé

Une partie de l'enthousiasme initial suscité par la loi d'échelle commence à s'estomper, mais ICML 2024 a démontré que tant de nouveaux talents, divers et créatifs, sont entrés dans notre domaine que nous pouvons être sûrs que le progrès est loin d'être terminé.

Nous avons passé un excellent moment à ICML 2024 et vous pouvez être sûrs que nous serons de retour en 2025 🇨🇦.

Catégories:
Événement
rss_feed

En savoir plus
août 11, 2025 • 8 minutes lues
What We Learned at SIGIR 2025
Michael Günther
Bo Wang
Scott Martens
Conference scene in a large auditorium with a "SIGIR 2025" banner on the projected screen, a speaker on stage, and attendees
mai 25, 2025 • 21 minutes lues
What We Learned at ICLR2025
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
novembre 05, 2024 • 2 minutes lues
Call for Participants: EMNLP 2024 BoF on Embeddings, Reranker & Small LMs for Better Search
Jina AI
Event poster for "Embedding Reranker, Small LM & Better Search" on Nov 14, 2024, from 10:30 to 12:00 at Miami Lecture Hall. F
Langue / thème actuel
Search Foundation
Reader
Embeddings
Reclasseur
Obtenir la clé API Jina
Limite de débit
À propos de nous
Actualités
Télécharger le logo Jina
open_in_new
Télécharger le logo Elastic
open_in_new
Statut de l'API
Elastic © 2026.SécuritéTermes et conditionsConfidentialitéGérer les cookiesNe vendez ni ne partagez mes informations personnelles
Ce site web et l'ensemble de son contenu, de ses logiciels, produits et services sont destinés exclusivement à un usage professionnel. Aucun usage à des fins de consommation n'est prévu.