← к ленте

Путь от внедрений к научным публикациям в Яндекс Музыке

I@inforetrieverавтор про «it»
1 мес

История о том, как команда Яндекс Музыки перешла от фокуса на KPI внедрений к активной научной деятельности и публикации статей на конференциях.

Где-то два с половиной года назад на конференции по рексистемам в Вышке, куда я пришел слушателем (так появилась секция кулуары, которой, кстати, давно не было), мне задали вопрос — почему у нас нет научных публикаций. Я ответил, что у ребят в Яндексе, занимающихся рексистемами, нет KPI на статьи — только KPI на внедрения. При этом я, конечно, не воспринимал вопрос лично, но сам уже долгое время горел идеей писать статьи, публиковаться на конференциях, участвовать в жизни научного сообщества. Через год я съездил на свою первую большую конференцию ACM RecSys’24. Про эту поездку есть целая серия постов; нетрудно понять, что мне очень понравилось)) Был даже маленький забавный моментик, когда я во время выступления Эда Чи что-то спросил, а он ответил “А может, вы про это статью и напишете” :) После всего этого я еще больше укрепился в решимости начать писать статьи. KPI не то чтобы после этого поменялся, но как будто подвернулся хороший момент, чтобы попробовать. Мы разработали и внедрили в Яндекс Музыку большую рекомендательную трансформерную модель (тот самый Аргус); и казалось логичным превратить это внедрение в статью. Затем, при подготовке лекции для ШАДа про LogQ коррекцию для двухбашенных моделей, я обнаружил ошибку в широко используемой по всему миру формуле. Когда я принес своим ребятам выкладки, далеко не все сразу поверили, что такое вообще возможно)) Было крайне нетривиально одновременно работать фуллтайм, преподавать новый курс в ШАДе и при этом еще и писать сразу две статьи. Но каким-то образом все получилось, и примерно год назад у нас сначала приняли на ACM RecSys’25 статью про LogQ коррекцию, а затем спустя еще полгода приняли на ACM KDD'26 статью про Аргуса. И вот я радостный стою уже 7 часов возле постера на рексисе и рассказываю всем окружающим про LogQ коррекцию)) А потом ночью в караоке пою Radiohead Creep в толпе рексисоидов И самое крутое, что мы на этом не остановились: * на тот же ACM RecSys’25 была принята работа про датасет Yambda, в которой я лично не участвовал, но поучаствовали ребята из нашей команды — Влад Тыцкий и Владимир Байкалов * на ACM SIGIR приняли статью Владимира Байкалова и его студентов из ИТМО про дообучение семантических айдишников * туда же на ACM SIGIR приняли статью от ребят из нашей (бывшей) команды — Артёма Матвеева, Влада Тыцкого, Сережи Макеева и Сережи Лямаева, про улучшение архитектуры энкодер-декодера для generative retrieval Ну и вот сейчас у нас приняли статью на воркшоп ACM KDD’26, продолжающую линию ресерча из статьи Top-K REINFORCE (я периодически шучу, что надо было её назвать "Correcting the Off-Policy Correction" в духе нашей LogQ статьи) и скрещивающую ее с generative retrieval. Про нее я написал в прошлом посте. Кроме того, на архиве появились препринты, про которые смею надеяться, что они дойдут до публикации: * мой Variable-Length Semantic IDs * Gryphon от ребят из Яндекса, в котором поучаствовали Олег Сорокин и Влад Додонов из нашей бывшей команды (читайте подробности про статью на канале Даши @redrecsys) И все это произошло только за последний год! Хочется верить, что мы только в начале нашего пути и нас всех ждет еще миллиард параметров приключений и публикаций :)

Кратко (AI)

Автор рассказывает о трансформации подхода команды Яндекс Музыки: от работы исключительно на бизнес-метрики к активной научной деятельности. За последний год команда подготовила и опубликовала ряд статей на престижных конференциях, таких как ACM RecSys, KDD и SIGIR, включая исследования по рекомендательным моделям и архитектурам.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖