Международная конференция по машинному обучению является одной из самых престижных конференций в сообществе машинного обучения и искусственного интеллекта и провела свое заседание 2024 года в Вене с 21 по 27 июля этого года.

Конференция представляла собой 7-дневный интенсивный учебный опыт с устными презентациями и возможностями прямого обмена идеями с другими исследователями. Ведется множество интересных работ в области обучения с подкреплением, ИИ для наук о жизни, обучения представлениям, мультимодальных моделей и, конечно же, в основных элементах разработки моделей ИИ. Особенно важным был учебный курс по физике больших языковых моделей, который подробно исследовал внутреннее устройство LLM и предложил убедительные ответы на вопрос о том, запоминают ли LLM информацию или применяют рассуждения при генерации ответов.
tagНаша работа над Jina-CLIP-v1
Мы представили постерный доклад о работе над нашей новой мультимодальной моделью jina-clip-v1 в рамках воркшопа Multi-modal Foundation Models meet Embodied AI.

Встреча и обсуждение нашей работы с международными коллегами, работающими во многих областях, была очень вдохновляющей. Наша презентация получила много положительных отзывов, многие заинтересовались тем, как Jina CLIP объединяет мультимодальные и одномодальные парадигмы контрастного обучения. Обсуждения варьировались от ограничений архитектуры CLIP до расширений для дополнительных модальностей и применений в сопоставлении пептидов и белков.
Михаэль Гюнтер представляет Jina CLIP
tagНаши фавориты
У нас была возможность обсудить множество проектов и презентаций других исследователей, и вот некоторые из наших фаворитов:
tagPlan Like a Graph (PLaG)
Многие знают о "Few-Shot Prompting" или "Chain of Thought prompting". Фангру Лин представила новый и лучший метод на ICML: Plan Like a Graph (PLaG).
Ее идея проста: задача, поставленная перед LLM, разбивается на подзадачи, которые LLM может решать параллельно или последовательно. Эти подзадачи формируют граф выполнения. Выполнение всего графа решает высокоуровневую задачу.
В видео выше Фангру Лин объясняет метод на легко понятном примере. Обратите внимание, что хотя это и улучшает результаты, LLM все еще страдают от серьезной деградации при увеличении сложности задач. Тем не менее, это все равно отличный шаг в правильном направлении, который дает немедленные практические преимущества.
Для нас интересно видеть, как ее работа перекликается с нашими применениями промптов в Jina AI. Мы уже реализовали графоподобную структуру промптов, однако динамическая генерация графа исполнения, как у нее, - это новое направление, которое мы будем исследовать.
tagОбнаружение сред с помощью XRM
В этой статье представлен простой алгоритм для обнаружения обучающих сред, которые могут заставить модель опираться на признаки, коррелирующие с метками, но не приводящие к точной классификации/релевантности. Известным примером является набор данных waterbirds (см. arXiv:1911.08731), который содержит фотографии птиц на разных фонах, которые должны быть классифицированы как водоплавающие или сухопутные птицы. Во время обучения классификатор определяет, показывает ли фон на изображениях воду или нет, вместо того чтобы полагаться на особенности самих птиц. Такая модель неправильно классифицирует водоплавающих птиц, если на фоне нет воды.
Чтобы смягчить это поведение, необходимо обнаружить образцы, где модель полагается на вводящие в заблуждение фоновые признаки. В этой статье представлен алгоритм XRM для решения этой задачи.
Алгоритм обучает две модели на двух различных частях обучающего набора данных. Во время обучения метки некоторых образцов переворачиваются. В частности, это происходит, если другая модель (которая не обучалась на соответствующем образце) классифицирует образец по-другому. Таким образом, модели поощряются полагаться на ложные корреляции. После этого можно извлечь образцы из обучающих данных, где метка, предсказанная одной из моделей, отличается от истинной. Позже эту информацию можно использовать для обучения более надежных моделей классификации, например, с помощью алгоритма Group DRO.
tagСократите затраты на оценку LLM в 140 раз!
Да, вы правильно услышали. С помощью этого приема стоимость оценки LLM может быть сокращена до крошечной доли.
Основная идея проста: удалить все образцы для оценки, которые тестируют одну и ту же способность модели. Математика, стоящая за этим, менее очевидна, но хорошо объяснена Felipe Maia Polo, который представил свою работу во время постерной сессии. Обратите внимание, что сокращение в 140 раз применимо к популярному набору данных MMLU (Massive Multitask Language Understanding). Для ваших собственных наборов данных для оценки это зависит от того, насколько результаты оценки образцов коррелируют друг с другом. Возможно, вы сможете пропустить много образцов или всего несколько.
Просто попробуйте. Мы сообщим вам, насколько нам в Jina AI удалось сократить количество образцов для оценки.
tagСопоставление множественных представлений с помощью Multi-Marginal Matching Gap

Эта работа решает распространенную проблему в контрастном обучении: большинство функций контрастных потерь, таких как InfoNCE, работают с парами точек данных и измеряют расстояние между положительными парами. Чтобы расширить положительные кортежи размера k > 2, контрастное обучение обычно пытается свести проблему к множеству пар и накапливать попарные потери для всех положительных пар. Авторы предлагают функцию потерь M3G (Multi-Marginal Matching Gap), модифицированную версию алгоритма Синкхорна, которая решает задачу мультимаргинального оптимального транспорта. Эта функция потерь может использоваться в сценариях, где наборы данных состоят из положительных кортежей размера k > 2, например, >2 изображений одного объекта, мультимодальных задач с тремя или более модальностями, или расширения SimCLR с тремя или более аугментациями одного изображения. Эмпирические результаты показывают, что этот метод превосходит наивное сведение проблемы к парам.
tagНе нужны размеченные данные!
Zachary Robertson из Stanford University представил свою работу по оценке LLM без каких-либо размеченных данных. Заметим, что хотя это теоретическая работа, она имеет большой потенциал для масштабируемого надзора за продвинутыми системами ИИ. Это не для обычных пользователей LLM, но если вы работаете над оценкой LLM, это определенно то, во что стоит углубиться. Мы уже видим, что могли бы таким образом оценивать наших агентов в Jina AI. Мы поделимся результатами, как только проведем первые эксперименты.
tagНеизбежен ли коллапс модели? Преодоление проклятия рекурсии путем накопления реальных и синтетических данных

Несколько статей (включая эту статью в Nature) недавно предсказали, что производительность новых обученных моделей может со временем ухудшаться, поскольку тренировочные данные, собранные из интернета, содержат всё больше синтетических данных.
Наш коллега Скотт Мартенс также опубликовал статью о коллапсе моделей и обсудил случаи, когда синтетические данные могут быть полезны для обучения моделей.

Процессы обучения моделей могут коллапсировать, потому что тренировочные данные создаются более ранней версией модели или моделью, обученной на тех же данных. Эта статья проводит эксперименты, которые показывают несколько иную картину: коллапс происходит только при замене реальных данных синтетическими, что делалось в предыдущих экспериментах. Однако при дополнении реальных данных синтетическими не наблюдается измеримых изменений в производительности получаемых моделей. Эти результаты предполагают, что коллапс моделей не произойдет. Тем не менее, это снова доказывает, что использование дополнительных синтетических данных не поможет обучить модель, которая была бы в целом лучше модели, использованной для создания этих синтетических данных.
tagНейрохирургия для ИИ теперь возможна
Предположим, вы хотите предсказать чью-то профессию, но не пол. Эта работа от Google Research, ETH Zürich, International Institute of Information Technology Hyderabad (IIITH) и Bar-Ilan University показывает, как управляющие векторы и согласование ковариации могут использоваться для контроля предвзятости.
tagMagicLens - Самоконтролируемый поиск изображений с открытыми инструкциями

Эта статья представляет модели MagicLens, серию самоконтролируемых моделей поиска изображений, обученных на триплетах запрос-изображение + инструкция + целевое изображение.
Авторы представляют конвейер сбора/обработки данных, который собирает пары изображений из интернета и использует LLM для синтеза открытых текстовых инструкций, связывающих изображения разнообразными семантическими отношениями, выходящими за рамки простого визуального сходства. Этот конвейер используется для создания 36.7M высококачественных триплетов с широким распределением. Затем набор данных используется для обучения простой архитектуры с двойным кодировщиком с общими параметрами. Базовые кодировщики зрения и языка инициализируются либо CoCa, либо вариантами CLIP base и large. Вводится единый пулер с множественным вниманием для сжатия двух мультимодальных входов в единое вложение. Целью обучения является противопоставление пары запрос-изображение и инструкции с целевым изображением и пустой строкой инструкции с помощью простой функции потерь InfoNCE для обучения MagicLens. Авторы представляют результаты оценки поиска изображений на основе инструкций.
tagPrompt Sketching - Новый способ промптинга
Способ, которым мы создаем промпты для LLM, меняется. Prompt Sketching позволяет задавать фиксированные ограничения для генеративных моделей. Вместо того чтобы просто давать инструкцию и надеяться, что модель сделает то, что вы хотите, вы определяете полный шаблон, заставляя модель генерировать именно то, что вам нужно.
Не путайте это с LLM, дообученными для предоставления структурированного формата JSON. При подходе с дообучением модель все еще имеет свободу генерировать что угодно. Не так с Prompt Sketching. Он предоставляет совершенно новый набор инструментов для инженеров промптов и открывает области исследований, которые необходимо изучить. В видео выше Марк Мюллер подробно объясняет, в чем суть этой новой парадигмы.
Вы также можете ознакомиться с их open-source проектом LMQL.
tagRepoformer - Селективный поиск для автодополнения кода на уровне репозитория
Для многих запросов RAG на самом деле не помогает модели, потому что запрос либо слишком прост, либо система поиска не может найти релевантные документы, возможно, потому что их нет. Это приводит к увеличению времени генерации и снижению производительности, если модель полагается на вводящие в заблуждение или отсутствующие источники.
Эта статья решает проблему, позволяя LLM самостоятельно оценивать, полезен ли поиск. Они демонстрируют этот подход на модели автодополнения кода, которая обучена заполнять пробелы в шаблоне кода. Для данного шаблона система сначала решает, полезны ли результаты поиска и, если да, вызывает поисковик. Наконец, LLM для кода генерирует отсутствующий контекст независимо от того, добавлены ли результаты поиска в его промпт.
tagПлатоновская гипотеза представления

Платоновская гипотеза представления утверждает, что нейронные сети будут стремиться к общему представлению мира. Заимствуя из теории форм Платона идею о существовании мира "идеалов", который является нам в искаженной форме, которую мы можем наблюдать только косвенно, авторы утверждают, что наши модели ИИ, похоже, сходятся к единому представлению реальности, независимо от архитектуры обучения, тренировочных данных или даже модальности входных данных. Чем больше масштаб данных и размер модели, тем более похожими становятся их представления.
Авторы рассматривают векторные представления и измеряют выравнивание представлений с помощью метрик выравнивания ядер, в частности метрики взаимных ближайших соседей, которая измеряет среднее пересечение наборов k-ближайших соседей, индуцированных двумя ядрами, K1 и K2, нормализованное по k. Эта работа представляет эмпирические доказательства того, что по мере увеличения размеров модели и набора данных и улучшения производительности, ядра становятся более выровненными. Это выравнивание также можно наблюдать даже при сравнении моделей разных модальностей, таких как текстовые модели и модели изображений.
tagИтоги
Некоторый первоначальный энтузиазм, связанный с законом масштабирования, начинает угасать, но ICML 2024 продемонстрировала, что в нашу область пришло так много новых, разнообразных, креативных талантов, что мы можем быть уверены — прогресс далек от завершения.
Нам было очень весело на ICML 2024, и можете быть уверены, что мы вернемся в 2025 🇨🇦.









