Яндекс представил метод для улучшения голосовых команд
Исследователи «Яндекса» предложили новый модульный метод, позволяющий добавлять голосовые команды в умные устройства без ухудшения распознавания уже известных фраз. Решение снижает риск «катастрофического забывания» и подходит для устройств с ограниченными ресурсами.
Crius
Исследователи компании «Яндекс» разработали новый метод, позволяющий устранить проблему «катастрофического забывания» при обновлении слов-триггеров для умных устройств. Этот подход обеспечивает возможность распознавания новых голосовых команд без потери способности определять уже знакомые фразы. Описание метода будет представлено на международной конференции Interspeech 2026, которая пройдет в Сиднее с 27 сентября по 1 октября.
Проблема катастрофического забывания
Производители умных колонок, автомобильных ассистентов и других голосовых помощников регулярно расширяют список команд, которые устройства могут распознавать автономно, без подключения к интернету. Для этого модели обычно дообучают на новых данных. Однако после обновления устройства иногда хуже распознают ранее известные команды. В машинном обучении этот эффект называют «катастрофическим забыванием». Для его снижения применяются методы непрерывного обучения, такие как elastic weight consolidation (EWC), однако они лишь уменьшают проблему, но не устраняют её полностью.
Новый модульный подход
Разработанный в «Яндексе» метод основан на модульном расширении модели. Вместо изменения всей нейросети добавляется небольшой дополнительный обучаемый модуль, отвечающий за распознавание новых команд. Этот модуль использует признаки, извлекаемые основной моделью, и имеет собственный классификатор для новых команд. При этом параметры базовой модели, включая нормализацию и основной классификатор, остаются неизменными. Такой подход позволяет сохранять точность распознавания старых команд, а новые команды добавляются путем обучения только дополнительного модуля, без перестройки всей системы. Увеличение размера нейросети при этом составляет менее 10%.
Сравнение с другими методами
В ходе экспериментов на открытом датасете Google Speech Commands была проверена эффективность нового подхода. Модель обучалась новым командам, при этом распознавание уже известных слов не ухудшалось. Новый метод снизил среднюю долю пропущенных новых команд (false reject rate, FRR) с 6,46% до 4,37% по сравнению с отдельной моделью аналогичного размера. Также он показал лучшие результаты по сравнению с методами адаптеров и LoRA. При полном дообучении всей модели новые команды усваивались хорошо, но точность распознавания старых команд снижалась: средняя доля забытых старых команд увеличивалась с 2,71% до 69,08%.
Применение
Разработанный подход может быть использован в умных колонках, бытовой технике, автомобильных голосовых помощниках и других устройствах с ограниченными вычислительными ресурсами.
