Оптимизация рекомендательных систем через Reinforcement Learning
M@machinelearning_interviewAI-инженер
2 недAI VK Research представили подход к обучению рекомендательных систем с учетом долгосрочной сессионной награды с помощью Reinforcement Learning.
Этот подход позволяет рекомендательным алгоритмам лучше удерживать внимание пользователя в долгосрочной перспективе.
- Переход от оптимизации отдельных кликов к оценке всей сессии пользователя.
- Использование Reinforcement Learning для более глубокого понимания поведения аудитории.
- Метод позволяет улучшить качество рекомендаций без ущерба для стандартных метрик.
Как научить рекомендательную систему думать не о следующем лайке, а обо всей сессии?
В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк, дослушивание.
Но каждое действие меняет состояние пользователя. Хорошая рекомендация сейчас может привести к плохому продолжению сессии — и наоборот.
AI VK Research попробовали решить эту задачу через Reinforcement Learning.
Рекомендации формулируются как RL-задача: пользователь — environment, модель — agent, рекомендация — action, а реакции пользователя становятся reward.
Главная сложность — обучаться приходится на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учесть разницу между поведением старой и новой политики и при этом не получить взрыв дисперсии.
В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций.
Источник:
https://habr.com/ru/companies/vk/articles/1068050/
#AI #Recsys #MachineLearning #RL

Кратко (AI)
Команда AI VK Research предложила использовать методы обучения с подкреплением (Reinforcement Learning) для оптимизации рекомендательных систем. Вместо предсказания одного действия пользователя, модель обучается максимизировать долгосрочную награду за всю сессию, используя off-policy коррекцию для обучения на исторических логах.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖