← к ленте

Оптимизация рекомендательных систем через Reinforcement Learning

2 нед

AI VK Research представили подход к обучению рекомендательных систем с учетом долгосрочной сессионной награды с помощью Reinforcement Learning.

Этот подход позволяет рекомендательным алгоритмам лучше удерживать внимание пользователя в долгосрочной перспективе.

  • Переход от оптимизации отдельных кликов к оценке всей сессии пользователя.
  • Использование Reinforcement Learning для более глубокого понимания поведения аудитории.
  • Метод позволяет улучшить качество рекомендаций без ущерба для стандартных метрик.
Как научить рекомендательную систему думать не о следующем лайке, а обо всей сессии? В классических рекомендациях модель обычно оптимизирует ближайший сигнал: клик, лайк, дослушивание. Но каждое действие меняет состояние пользователя. Хорошая рекомендация сейчас может привести к плохому продолжению сессии — и наоборот. AI VK Research попробовали решить эту задачу через Reinforcement Learning. Рекомендации формулируются как RL-задача: пользователь — environment, модель — agent, рекомендация — action, а реакции пользователя становятся reward. Главная сложность — обучаться приходится на логах старой модели. Авторы используют REINFORCE с многошаговой off-policy коррекцией, чтобы учесть разницу между поведением старой и новой политики и при этом не получить взрыв дисперсии. В экспериментах подход улучшил оценку долгосрочной сессионной награды без существенной потери стандартных метрик рекомендаций. Источник: https://habr.com/ru/companies/vk/articles/1068050/ #AI #Recsys #MachineLearning #RL
Оптимизация рекомендательных систем через Reinforcement Learning

Кратко (AI)

Команда AI VK Research предложила использовать методы обучения с подкреплением (Reinforcement Learning) для оптимизации рекомендательных систем. Вместо предсказания одного действия пользователя, модель обучается максимизировать долгосрочную награду за всю сессию, используя off-policy коррекцию для обучения на исторических логах.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖