Авито: сравнение uplift-моделей для оценки индивидуального эффекта воздействия
Описание проекта
Сравнительное исследование четырёх подходов к оценке индивидуального эффекта воздействия: S-learner (одна модель на всех данных с воздействием как признаком), T-learner (две независимые модели для групп T=1 и T=0), X-learner (двухстадийный подход с взвешиванием по propensity и моделированием псевдо-исхода) и Causal Forest (древесный ансамбль, оптимизирующий обнаружение гетерогенного эффекта). Все на градиентном бустинге с параметрами по умолчанию. Метрика — PEHE, корень среднеквадратичной ошибки предсказания индивидуального причинного эффекта. Групповой этап — синтетика по трём сценариям (5000 наблюдений, 10 признаков), плей-офф — полусинтетика на реальных ковариатах из e-commerce и спортивных данных.
Вендор и технология: Авито, мета-лернеры на градиентном бустинге и Causal Forest.
Задача
Для оценки индивидуального эффекта воздействия существует несколько семейств моделей, и на практике непонятно, какое выбрать. Универсального ответа нет: поведение сильно зависит от дисбаланса классов, силы эффекта и структуры взаимодействий.
Цели внедрения
-
Сравнить четыре семейства uplift-моделей на единой метрике
-
проверить поведение при дисбалансе воздействия
-
проверить при слабом эффекте
-
проверить при асимметричных нелинейных эффектах
-
выложить воспроизводимый код
Результаты
-
Результаты
-
Групповой этап — при дисбалансе (10% воздействия) победил Causal Forest с PEHE 0,318
-
при слабом эффекте (размер 0,05) победил S-learner с PEHE 0,049
-
при асимметричных нелинейных взаимодействиях победил X-learner с PEHE 0,438
-
полуфиналы — T-learner 0,406 на e-commerce с конфаундингом, X-learner 0,215 на задаче с чёткой сегментацией
-
финал на данных FIFA 21 (около 10 000 игроков) выиграл X-learner с PEHE 0,579
-
вывод — универсальной «серебряной пули» нет
-
код выложен на GitHub Нагрузка и масштаб
-
Синтетика по 5000 наблюдений и 10 признаков, финал на выборке около 10 000 объектов Сроки
-
Публикация 22.07.2026