Яндекс: быстрые голосовые команды в умных колонках Алисы
Описание проекта
Компактная нейросеть весом от 0,5 до 1,5 МБ в зависимости от железа устройства распознаёт короткие команды («дальше», «тише») без обращения по имени. Архитектура близка к решению в наушниках Яндекс Дропс. Модель обрабатывает фиксированный аудиоконтекст слева и справа от фразы, причём около двух секунд предшествующего звука нужны, чтобы не срабатывать на посторонней речи. Для добавления новых команд («лайк», «дизлайк», «включи блютус», «выключи блютус») применён модульный подход Parameter-Efficient Fine-Tuning с параллельными ветками: одна ветка заморожена и держит качество старых команд, вторая обучается на новые, векторы активаций конкатенируются на каждом шаге. Обучение двухстадийное, чтобы модель не переобучилась на слово «Алиса», часто стоящее перед новой командой в реальных логах.
Вендор и технология: Яндекс, компактная сеть распознавания ключевых слов с модульным PEFT-расширением.
Задача
Добавление новых команд в единую модель рисковало деградацией уже работающих команд, и не было гарантий сохранения качества. В реальных логах перед новыми командами часто звучит слово «Алиса», из-за чего модель переобучалась на него.
Цели внедрения
-
Добавлять новые команды без деградации старых
-
уложиться в память и CPU устройства
-
снизить ложные срабатывания
-
сохранить знание базовой модели при обучении новой ветки
-
обеспечить работу без обращения по имени
Результаты
-
Результаты
-
Ложные срабатывания снижены примерно на 60%
-
потребление CPU снижено примерно на 35%
-
потребление RAM снижено примерно на 50%
-
размер модели 0,5–1,5 МБ
-
претрейн на 60–100 млн сэмплов из логов ASR, дообучение на 400 тыс. — 1 млн записанных пользовательских фраз Нагрузка и масштаб
-
Умные колонки Яндекса, обучение на 60–100 млн сэмплов Сроки
-
Публикация 23.07.2026, работа принята на Interspeech 2026 под названием «Scalable Keyword Spotting via Modular Network Expansion»