Elastic
Jina AI
Модели
API
keyboard_arrow_down
Reader
Конвертируйте любой URL в Markdown для лучшей привязки LLM к источникам.
Эмбеддинги
Мультимодальные многоязычные векторные представления.
Реранкер
Реранкер для максимизации релевантности результатов поиска.
MCP
terminal
CLI
article
llms.txt
smart_toy
Агенты
data_object
Схема
menu_book
Документация
Авторизоваться
login
Наша работа над Jina-CLIP-v1
Наши фавориты
Итоги
Событие
август 07, 2024

Что мы узнали на ICML2024: PLaG, XRM, tinyBenchmark, MagicLens, Prompt Sketching и другие

Мы отлично провели время на ICML 2024 в Вене и хотим поделиться с вами всем, что мы рассказали, увидели и узнали.
Two logos on gray background: upper "ICML International Conference on Machine Learning," lower abstract "vibo" logo.
Florian Hönicke, Michael Günther, Georgios Mastrapas, Scott Martens • 10 минуты чтения

Международная конференция по машинному обучению является одной из самых престижных конференций в сообществе машинного обучения и искусственного интеллекта и провела свое заседание 2024 года в Вене с 21 по 27 июля этого года.

Interior of a bustling academic conference hall with many attendees, some carrying backpacks, and research posters displayed

Конференция представляла собой 7-дневный интенсивный учебный опыт с устными презентациями и возможностями прямого обмена идеями с другими исследователями. Ведется множество интересных работ в области обучения с подкреплением, ИИ для наук о жизни, обучения представлениям, мультимодальных моделей и, конечно же, в основных элементах разработки моделей ИИ. Особенно важным был учебный курс по физике больших языковых моделей, который подробно исследовал внутреннее устройство LLM и предложил убедительные ответы на вопрос о том, запоминают ли LLM информацию или применяют рассуждения при генерации ответов.

tagНаша работа над Jina-CLIP-v1

Мы представили постерный доклад о работе над нашей новой мультимодальной моделью jina-clip-v1 в рамках воркшопа Multi-modal Foundation Models meet Embodied AI.

Jina CLIP: Your CLIP Model Is Also Your Text Retriever
Contrastive Language-Image Pretraining (CLIP) is widely used to train models to align images and texts in a common embedding space by mapping them to fixed-sized vectors. These models are key to multimodal information retrieval and related tasks. However, CLIP models generally underperform in text-only tasks compared to specialized text models. This creates inefficiencies for information retrieval systems that keep separate embeddings and models for text-only and multimodal tasks. We propose a novel, multi-task contrastive training method to address this issue, which we use to train the jina-clip-v1 model to achieve the state-of-the-art performance on both text-image and text-text retrieval tasks.
arXiv.orgAndreas Koukounas

Встреча и обсуждение нашей работы с международными коллегами, работающими во многих областях, была очень вдохновляющей. Наша презентация получила много положительных отзывов, многие заинтересовались тем, как Jina CLIP объединяет мультимодальные и одномодальные парадигмы контрастного обучения. Обсуждения варьировались от ограничений архитектуры CLIP до расширений для дополнительных модальностей и применений в сопоставлении пептидов и белков.

0:00
/3:09

Михаэль Гюнтер представляет Jina CLIP

tagНаши фавориты

У нас была возможность обсудить множество проектов и презентаций других исследователей, и вот некоторые из наших фаворитов:

tagPlan Like a Graph (PLaG)

Lin, F., La Malfa, E., Hofmann, V., Yang, E. M., Cohn, A., & Pierrehumbert, J. B. (2024). Graph-Enhanced Large Language Models in Asynchronous Plan Reasoning. arXiv:2402.02805

Многие знают о "Few-Shot Prompting" или "Chain of Thought prompting". Фангру Лин представила новый и лучший метод на ICML: Plan Like a Graph (PLaG).

Ее идея проста: задача, поставленная перед LLM, разбивается на подзадачи, которые LLM может решать параллельно или последовательно. Эти подзадачи формируют граф выполнения. Выполнение всего графа решает высокоуровневую задачу.

В видео выше Фангру Лин объясняет метод на легко понятном примере. Обратите внимание, что хотя это и улучшает результаты, LLM все еще страдают от серьезной деградации при увеличении сложности задач. Тем не менее, это все равно отличный шаг в правильном направлении, который дает немедленные практические преимущества.

Для нас интересно видеть, как ее работа перекликается с нашими применениями промптов в Jina AI. Мы уже реализовали графоподобную структуру промптов, однако динамическая генерация графа исполнения, как у нее, - это новое направление, которое мы будем исследовать.

tagОбнаружение сред с помощью XRM

Pezeshki, M., Bouchacourt, D., Ibrahim, M., Ballas, N., Vincent, P., & Lopez-Paz, D. (2024). Discovering Environments with XRM. arXiv:2309.16748

В этой статье представлен простой алгоритм для обнаружения обучающих сред, которые могут заставить модель опираться на признаки, коррелирующие с метками, но не приводящие к точной классификации/релевантности. Известным примером является набор данных waterbirds (см. arXiv:1911.08731), который содержит фотографии птиц на разных фонах, которые должны быть классифицированы как водоплавающие или сухопутные птицы. Во время обучения классификатор определяет, показывает ли фон на изображениях воду или нет, вместо того чтобы полагаться на особенности самих птиц. Такая модель неправильно классифицирует водоплавающих птиц, если на фоне нет воды.

Чтобы смягчить это поведение, необходимо обнаружить образцы, где модель полагается на вводящие в заблуждение фоновые признаки. В этой статье представлен алгоритм XRM для решения этой задачи.

Алгоритм обучает две модели на двух различных частях обучающего набора данных. Во время обучения метки некоторых образцов переворачиваются. В частности, это происходит, если другая модель (которая не обучалась на соответствующем образце) классифицирует образец по-другому. Таким образом, модели поощряются полагаться на ложные корреляции. После этого можно извлечь образцы из обучающих данных, где метка, предсказанная одной из моделей, отличается от истинной. Позже эту информацию можно использовать для обучения более надежных моделей классификации, например, с помощью алгоритма Group DRO.

tagСократите затраты на оценку LLM в 140 раз!

Maia Polo, F., Weber, L., Choshen, L., Sun, Y., Xu, G., & Yurochkin, M. (2024). tinyBenchmarks: evaluating LLMs with Fewer Examples. arXiv:2402.14992

Да, вы правильно услышали. С помощью этого приема стоимость оценки LLM может быть сокращена до крошечной доли.

Основная идея проста: удалить все образцы для оценки, которые тестируют одну и ту же способность модели. Математика, стоящая за этим, менее очевидна, но хорошо объяснена Felipe Maia Polo, который представил свою работу во время постерной сессии. Обратите внимание, что сокращение в 140 раз применимо к популярному набору данных MMLU (Massive Multitask Language Understanding). Для ваших собственных наборов данных для оценки это зависит от того, насколько результаты оценки образцов коррелируют друг с другом. Возможно, вы сможете пропустить много образцов или всего несколько.

Просто попробуйте. Мы сообщим вам, насколько нам в Jina AI удалось сократить количество образцов для оценки.

tagСопоставление множественных представлений с помощью Multi-Marginal Matching Gap

Piran, Z., Klein, M., Thornton, J., & Cuturi, M. (2024). Contrasting Multiple Representations with the Multi-Marginal Matching Gap. arXiv:2405.19532
Research paper diagram illustrating Multi-Marginal Matching Gap concepts, with titles, descriptions, and flow charts in blue

Эта работа решает распространенную проблему в контрастном обучении: большинство функций контрастных потерь, таких как InfoNCE, работают с парами точек данных и измеряют расстояние между положительными парами. Чтобы расширить положительные кортежи размера k > 2, контрастное обучение обычно пытается свести проблему к множеству пар и накапливать попарные потери для всех положительных пар. Авторы предлагают функцию потерь M3G (Multi-Marginal Matching Gap), модифицированную версию алгоритма Синкхорна, которая решает задачу мультимаргинального оптимального транспорта. Эта функция потерь может использоваться в сценариях, где наборы данных состоят из положительных кортежей размера k > 2, например, >2 изображений одного объекта, мультимодальных задач с тремя или более модальностями, или расширения SimCLR с тремя или более аугментациями одного изображения. Эмпирические результаты показывают, что этот метод превосходит наивное сведение проблемы к парам.

tagНе нужны размеченные данные!

Robertson, Z., Cha, H., Sheha, A., & Koyejo, S. (2024). Implementability of Information Elicitation Mechanisms with Pre-Trained Language Models. In ICML 2024 Workshop on Theoretical Foundations of Foundation Models. URL https://openreview.net/forum?id=QqMnRGlRJk

Zachary Robertson из Stanford University представил свою работу по оценке LLM без каких-либо размеченных данных. Заметим, что хотя это теоретическая работа, она имеет большой потенциал для масштабируемого надзора за продвинутыми системами ИИ. Это не для обычных пользователей LLM, но если вы работаете над оценкой LLM, это определенно то, во что стоит углубиться. Мы уже видим, что могли бы таким образом оценивать наших агентов в Jina AI. Мы поделимся результатами, как только проведем первые эксперименты.

tagНеизбежен ли коллапс модели? Преодоление проклятия рекурсии путем накопления реальных и синтетических данных

Gerstgrasser, M., Schaeffer, R., Dey, A., Rafailov, R., Sleight, H., Hughes, J., Korbak, T., Agrawal, R., Pai, D., Gromov, A., Roberts, D. A., Yang, D., Donoho, D. L., & Koyejo, S. (2024). Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data. arXiv:2404.01413
Illustration of two machine learning data processes: "Replace Data" and "Accumulate Data", with detailed flowcharts and model

Несколько статей (включая эту статью в Nature) недавно предсказали, что производительность новых обученных моделей может со временем ухудшаться, поскольку тренировочные данные, собранные из интернета, содержат всё больше синтетических данных.

Наш коллега Скотт Мартенс также опубликовал статью о коллапсе моделей и обсудил случаи, когда синтетические данные могут быть полезны для обучения моделей.

When AI Makes AI: Synthetic Data, Model Distillation, And Model Collapse
AI creating AI! Is it the end of the world? Or just another tool to make models do value-adding work? Let's find out!

Процессы обучения моделей могут коллапсировать, потому что тренировочные данные создаются более ранней версией модели или моделью, обученной на тех же данных. Эта статья проводит эксперименты, которые показывают несколько иную картину: коллапс происходит только при замене реальных данных синтетическими, что делалось в предыдущих экспериментах. Однако при дополнении реальных данных синтетическими не наблюдается измеримых изменений в производительности получаемых моделей. Эти результаты предполагают, что коллапс моделей не произойдет. Тем не менее, это снова доказывает, что использование дополнительных синтетических данных не поможет обучить модель, которая была бы в целом лучше модели, использованной для создания этих синтетических данных.

tagНейрохирургия для ИИ теперь возможна

Singh, S., Ravfogel, S., Herzig, J., Aharoni, R., Cotterell, R., & Kumaraguru, P. (2024). Representation Surgery: Theory and Practice of Affine Steering. arXiv:2402.09631

Предположим, вы хотите предсказать чью-то профессию, но не пол. Эта работа от Google Research, ETH Zürich, International Institute of Information Technology Hyderabad (IIITH) и Bar-Ilan University показывает, как управляющие векторы и согласование ковариации могут использоваться для контроля предвзятости.

tagMagicLens - Самоконтролируемый поиск изображений с открытыми инструкциями

Zhang, K., Luan, Y., Hu, H., Lee, K., Qiao, S., Chen, W., Su, Y., & Chang, M.-W. (2024). MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions. arXiv:2403.19651
Interactive slide showing MagicLens tool for visually guided navigation with tasks like identifying buildings and comparing h

Эта статья представляет модели MagicLens, серию самоконтролируемых моделей поиска изображений, обученных на триплетах запрос-изображение + инструкция + целевое изображение.

Авторы представляют конвейер сбора/обработки данных, который собирает пары изображений из интернета и использует LLM для синтеза открытых текстовых инструкций, связывающих изображения разнообразными семантическими отношениями, выходящими за рамки простого визуального сходства. Этот конвейер используется для создания 36.7M высококачественных триплетов с широким распределением. Затем набор данных используется для обучения простой архитектуры с двойным кодировщиком с общими параметрами. Базовые кодировщики зрения и языка инициализируются либо CoCa, либо вариантами CLIP base и large. Вводится единый пулер с множественным вниманием для сжатия двух мультимодальных входов в единое вложение. Целью обучения является противопоставление пары запрос-изображение и инструкции с целевым изображением и пустой строкой инструкции с помощью простой функции потерь InfoNCE для обучения MagicLens. Авторы представляют результаты оценки поиска изображений на основе инструкций.

tagPrompt Sketching - Новый способ промптинга

Beurer-Kellner, L., Müller, M. N., Fischer, M., & Vechev, M. (2023). Prompt Sketching for Large Language Models. arXiv:2311.04954

Способ, которым мы создаем промпты для LLM, меняется. Prompt Sketching позволяет задавать фиксированные ограничения для генеративных моделей. Вместо того чтобы просто давать инструкцию и надеяться, что модель сделает то, что вы хотите, вы определяете полный шаблон, заставляя модель генерировать именно то, что вам нужно.

Не путайте это с LLM, дообученными для предоставления структурированного формата JSON. При подходе с дообучением модель все еще имеет свободу генерировать что угодно. Не так с Prompt Sketching. Он предоставляет совершенно новый набор инструментов для инженеров промптов и открывает области исследований, которые необходимо изучить. В видео выше Марк Мюллер подробно объясняет, в чем суть этой новой парадигмы.

Вы также можете ознакомиться с их open-source проектом LMQL.

tagRepoformer - Селективный поиск для автодополнения кода на уровне репозитория

Wu, D., Ahmad, W. U., Zhang, D., Ramanathan, M. K., & Ma, X. (2024). Repoformer: Selective Retrieval for Repository-Level Code Completion. arXiv:2403.10059

Для многих запросов RAG на самом деле не помогает модели, потому что запрос либо слишком прост, либо система поиска не может найти релевантные документы, возможно, потому что их нет. Это приводит к увеличению времени генерации и снижению производительности, если модель полагается на вводящие в заблуждение или отсутствующие источники.

Эта статья решает проблему, позволяя LLM самостоятельно оценивать, полезен ли поиск. Они демонстрируют этот подход на модели автодополнения кода, которая обучена заполнять пробелы в шаблоне кода. Для данного шаблона система сначала решает, полезны ли результаты поиска и, если да, вызывает поисковик. Наконец, LLM для кода генерирует отсутствующий контекст независимо от того, добавлены ли результаты поиска в его промпт.

tagПлатоновская гипотеза представления

Huh, M., Cheung, B., Wang, T., & Isola, P. (2024). The Platonic Representation Hypothesis. arXiv:2405.07987
Illustration of "The Platonic Representation Hypothesis" with geometric shapes, mathematical text, and diagrams explaining a

Платоновская гипотеза представления утверждает, что нейронные сети будут стремиться к общему представлению мира. Заимствуя из теории форм Платона идею о существовании мира "идеалов", который является нам в искаженной форме, которую мы можем наблюдать только косвенно, авторы утверждают, что наши модели ИИ, похоже, сходятся к единому представлению реальности, независимо от архитектуры обучения, тренировочных данных или даже модальности входных данных. Чем больше масштаб данных и размер модели, тем более похожими становятся их представления.

Авторы рассматривают векторные представления и измеряют выравнивание представлений с помощью метрик выравнивания ядер, в частности метрики взаимных ближайших соседей, которая измеряет среднее пересечение наборов k-ближайших соседей, индуцированных двумя ядрами, K1 и K2, нормализованное по k. Эта работа представляет эмпирические доказательства того, что по мере увеличения размеров модели и набора данных и улучшения производительности, ядра становятся более выровненными. Это выравнивание также можно наблюдать даже при сравнении моделей разных модальностей, таких как текстовые модели и модели изображений.

tagИтоги

Некоторый первоначальный энтузиазм, связанный с законом масштабирования, начинает угасать, но ICML 2024 продемонстрировала, что в нашу область пришло так много новых, разнообразных, креативных талантов, что мы можем быть уверены — прогресс далек от завершения.

Нам было очень весело на ICML 2024, и можете быть уверены, что мы вернемся в 2025 🇨🇦.

Категории:
Событие
rss_feed

Читать далее
август 11, 2025 • 8 минуты чтения
What We Learned at SIGIR 2025
Michael Günther
Bo Wang
Scott Martens
Conference scene in a large auditorium with a "SIGIR 2025" banner on the projected screen, a speaker on stage, and attendees
май 25, 2025 • 21 минуты чтения
What We Learned at ICLR2025
Jina AI
Three people smiling on a stage at a conference with an ICLR banner visible, suggesting a warm and lively event atmosphere.
ноябрь 05, 2024 • 2 минуты чтения
Call for Participants: EMNLP 2024 BoF on Embeddings, Reranker & Small LMs for Better Search
Jina AI
Event poster for "Embedding Reranker, Small LM & Better Search" on Nov 14, 2024, from 10:30 to 12:00 at Miami Lecture Hall. F
Текущий язык / тема
Search Foundation
Reader
Эмбеддинги
Реранкер
Получить API-ключ Jina
Ограничение скорости
О нас
Новости
Загрузить логотип Jina
open_in_new
Скачать логотип Elastic
open_in_new
Статус API
Elastic © 2026.БезопасностьУсловия использованияКонфиденциальностьУправление файлами cookieНе продавайте и не передавайте мою личную информацию третьим лицам.
Данный веб-сайт и весь связанный с ним контент, программное обеспечение, продукты и услуги предназначены исключительно для профессионального использования. Использование в потребительских целях не предполагается и не рекомендуется.