Планирование рекомендаций через матричную факторизацию и MCTS
M@machinelearning_interviewAI-инженер
1 месИсследователи AI VK представили метод улучшения рекомендаций через MCTS и матричную факторизацию, учитывающий динамику профиля пользователя.
Как научить матричную факторизацию реально планировать рекомендации на несколько шагов вперед
Несмотря на развитие рекомендательных трансформеров и генеративных моделей, матричные факторизации по-прежнему широко применяются в рекомендательных системах.
Обычно система берёт top-K айтемов, которые ближе всего к текущему эмбеддингу пользователя, не учитывая, как показ рекомендации изменит его профиль и последующие выдачи.
Исследователи AI VK решили добавить к ALS планирование через Monte Carlo Tree Search.
Работу Planning over Matrix-Factorization MDPs for Candidate Generation приняли на воркшопе Customer Journey в рамках KDD 2026.
### Как устроен подход
За основу взяли ALS и механику обновления профилей из сервиса Profile Stream во VK. Эмбеддинг пользователя там пересчитывается после новых взаимодействий, поэтому процесс можно представить как RL-среду:
- состояние — текущий эмбеддинг пользователя;
- действие — показ конкретного айтема;
- награда — близость к релевантным айтемам;
- переход — обновление эмбеддинга по формулам ALS в допущении оптимистичной среды
MCTS строит дерево возможных последовательностей рекомендаций. Каждая вершина соответствует состоянию пользователя, а ветви — кандидатам из top-K.
В офлайн-экспериментах использовался оптимистичный сценарий: при переходе считалось, что пользователю понравился показанный айтем. Далее профиль обновлялся, и поиск продолжался уже из нового состояния.
В результате
Эксперименты провели на VK-LSVD, MovieLens-1M, KuaiRec, Yambda.
При протоколе Leave-last-n планирование превзошло статический top-K на всех датасетах. На некоторых срезах VK-LSVD показатель Recall@10 вырос примерно в 1,5 раза.
При Global time split, который ближе к реальному продакшн-сценарию, прирост сохранился на MovieLens-1M и VK-LSVD.
Работа показывает, что поверх относительно лёгкой ALS можно использовать RL-планирование и учитывать будущую динамику пользовательского профиля.
Следующие шаги: моделирование стохастической среды по логам и дистилляция MCTS-агента в быструю политику в духе MuZero.
#aivkhub #rl #mcts #als
Кратко (AI)
Исследователи из AI VK предложили метод улучшения рекомендательных систем, объединяющий классическую матричную факторизацию (ALS) с планированием через Monte Carlo Tree Search (MCTS). Подход рассматривает обновление профиля пользователя как RL-среду, что позволяет предсказывать влияние рекомендаций на будущие интересы пользователя. Метод показал значительный рост метрики Recall@10 на различных датасетах по сравнению со статическим top-K.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖