VK и НИУ ВШЭ: шумоподавление SESAME на разреженной смеси экспертов
Описание проекта
SESAME (Speech Enhancement with Sparse Adaptive Mixture of Experts) строится на MP-SENet, где стандартные полносвязные блоки заменены разреженными модулями смеси экспертов: 4 эксперта, 2 активных на токен, стратегия маршрутизации Token Choice, а не привычная для языковых моделей Expert Choice. Ключевая новинка — «профиль шума», 64-мерный глобальный дескриптор аудио, который подсказывает, какие эксперты должны обрабатывать какие частотно-временные токены, повышая специализацию за пределами локального контекста. Разные эксперты специализируются на стационарном и импульсном шуме и на разных уровнях SNR.
Вендор и технология: VK совместно со студентами ИМШ НИУ ВШЭ, модель SESAME на базе MP-SENet.
Задача
Монолитные архитектуры применяют одни и те же веса ко всем участкам аудио независимо от типа шума. Это ограничивает качество на разнородных акустических условиях.
Цели внедрения
-
Специализировать обработку под тип шума
-
снизить число активных параметров
-
превзойти MP-SENet large по PESQ
-
ввести глобальный дескриптор шума для маршрутизации
-
выложить код в open source
Результаты
-
Результаты
-
На VoiceBank+DEMAND: PESQ 3,64 против 3,61 у MP-SENet large
-
активных параметров 2,87 млн против 3,59 млн у базовой модели (сокращение на 20%)
-
SSNR 10,93 дБ
-
CSIG/CBAK/COVL 4,84/4,04/4,37
-
код выложен на GitHub (nullpath-ml/SESAME) Нагрузка и масштаб
-
Обучение и валидация на VoiceBank+DEMAND Сроки
-
Публикация 02.09.2026