← к ленте

Впечатления от конференции ICML 2026

Д@stuffyNLPAI-инженер
1 мес

Старший разработчик YandexGPT Владислав Тыцкий делится личными впечатлениями от конференции ICML 2026 и разбирает ключевые научные статьи.

ICML 2026 — личные впечатления Конференция закончилась, но говорить о ней можно ещё долго. Сегодня личными впечатлениями с нашим каналом поделился старший разработчик команды инфраструктуры обучения YandexGPT Владислав Тыцкий.
Конференция ощущалась очень масштабной: много людей, огромные залы для докладов, плотное расписание и буквально бесконечное количество постеров. Иногда возникало ощущение, что между интересными работами нужно не ходить, а почти бегать. Для себя я в основном смотрел темы вокруг pretraining, scaling, MoE, efficient training и разных попыток лучше понять динамику обучения LLM. В этом смысле конференция оказалась очень насыщенной: почти в каждой постерной сессии находилось несколько работ, которые хотелось разобрать подробнее. Постерный формат показался мне самым полезным. На докладах — особенно в больших залах — немного теряется камерность: масштаб впечатляет, но вовлечённость аудитории ощущается слабее. У постера проще быстро понять основную идею, задать автору вопрос и уйти либо с хорошим инсайтом, либо с пониманием, что работа тебе не очень релевантна. Отдельно понравилась инфраструктура конференции. У ICML очень удобные сайт и приложение: можно собирать расписание, смотреть материалы онлайн, возвращаться к записям и в целом не чувствовать, что ты полностью пропустил материал, если не успел попасть на доклад. Плюс Gangnam оказался приятным районом для такой конференции: вокруг много кофеен, мест для еды и просто красивый бизнес-квартал, по которому интересно гулять между сессиями. ICML большая, шумная и местами немного перегруженная, но при этом очень полезная. Особенно если заранее понимать, какие темы тебе интересны, и не пытаться посмотреть вообще всё.
Владислав также рассказал о некоторых запомнившихся постерах. Variational Routing: A Scalable Bayesian Framework for Calibrated Mixture-of-Experts Transformers Статья об uncertainty-aware routing в MoE. Идея в том, чтобы добавить неопределённость именно в router — место, где MoE и так принимает важное и довольно хрупкое решение. Практически интересно, что такой слой можно дообучать уже поверх обученных моделей. В экспериментах это улучшает калибровку и устойчивость роутера к шуму при небольшом дополнительном компьюте. Decoupling the “What” and “Where” With Polar Coordinate Positional Embeddings Работа о позиционных эмбеддингах и RoPE. Авторы обсуждают, что в RoPE могут смешиваться content- и position-информация, и предлагают PoPE — способ лучше развести «что» и «где». Не уверен, что это прямо новый дефолт вместо RoPE, но сама идея про content phase и positional phase показалась интересной. BAS: Bridging Adam and SignSGD for Memory-Efficient LLM Training Постер о memory-efficient-оптимизации. Авторы пытаются приблизиться к Adam-like динамике, но снизить память за счёт block-wise статистик. Плюс используют трюк с sign update, что делает работу интересной не только с точки зрения оптимизации, но и с точки зрения практических ограничений больших обучений. Revisiting Efficiency–Accuracy Scaling in Mixture-of-Experts Architectures Hardware-aware-работа о трейд-оффе между качеством и стоимостью MoE. Авторы предлагают LatentMoE: скоры роутера считаются в исходном пространстве, после чего токены — перед отправкой к экспертам — проецируются в пространство меньшей размерности. Это уменьшает объём all-to-all и стоимость вычисления экспертов. Сэкономленный бюджет можно вложить в большее число экспертов и больший top-k. #YaICML2026 Душный NLP

Кратко (AI)

Старший разработчик YandexGPT Владислав Тыцкий подвел итоги конференции ICML 2026, отметив высокую насыщенность мероприятия и эффективность постерных сессий. В обзоре представлены ключевые научные работы по темам MoE, оптимизации обучения и позиционных эмбеддингов, включая Variational Routing и LatentMoE.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖