VK: обучение с подкреплением для сессионной оптимизации рекомендаций
Описание проекта
Система из трёх компонентов: замороженная behavior policy — двухбашенный трансформер, предсказывающий вероятности действий по истории; обучаемая target policy той же архитектуры, тренируемая off-policy REINFORCE с весами importance sampling; и user model — трансформер, предсказывающий лайки и доли прослушивания для симуляции траекторий. Ключевая идея — брать не более K множителей в весах важности вместо произведения по всей траектории, оптимальное K = 10. Награда r_t = Like + 0,1 × listening_ratio, дисконт γ = 0,9, длина последовательности 512 событий.
Вендор и технология: VK, off-policy REINFORCE с многошаговой коррекцией важности.
Задача
Классические рекомендательные модели оптимизируют ближайшее взаимодействие (next-item prediction), тогда как каждый выданный элемент влияет на дальнейшее поведение пользователя. Жадные модели максимизируют мгновенную награду в ущерб удовлетворённости за сессию.
Цели внедрения
-
Перейти от next-item к сессионной оптимизации
-
корректно оценить off-policy обучение на логах
-
сбалансировать смещение и дисперсию в весах важности
-
проверить подход на промышленном объёме данных
-
опубликовать результаты на KDD 2026
Результаты
-
Результаты
-
Step-IS (OPE) 1,4677 против 1,3065 у NIP-CE и 1,3317 у Positive-CE
-
DM 0,5395 против 0,5279 и 0,5384
-
DR 0,6306 против 0,6046 и 0,6184
-
Recall@100 0,3086 против 0,3153 и 0,3029
-
оптимальное K = 10
-
датасет Yambda-5B на 5 млрд взаимодействий Нагрузка и масштаб
-
5 млрд взаимодействий, последовательности по 512 событий Сроки
-
Работа представлена на воркшопе KDD 2026 «End-to-End Customer Journey Optimization», публикация 12.08.2026