← к умной ленте

Яндекс решил проблему «катастрофического забывания» у голосовых помощников

Исследователи Яндекса нашли способ добавлять новые голосовые команды в устройства с офлайн-распознаванием речи (например, умные колонки) без потери качества распознавания старых команд. Раньше при дообучении модели новыми фразами она резко теряла точность на старых: доля пропущенных знакомых команд взлетала с 2,71% до 69% (по данным Хабра — до 69,08%).

Вместо переобучения всей модели или подбора ограничений (как в методе EWC) команда предложила модульное расширениеi: основную нейросеть замораживают, а к ней подключают небольшой лёгкий модуль, который переиспользует активации старых слоёв и учится распознавать только новые команды. Это позволяет обновлять умные устройства с ограниченными ресурсами, не переобучая систему целиком и не рискуя ломать уже работающие функции — и всё работает прямо на устройстве без интернета.

2,71%ошибки на старых командах до дообучения
69%ошибки на старых командах после стандартного дообучения
4,37%ошибки на новых командах в новом методе
  • Стандартное дообучение подняло долю ошибок на старых командах с 2,71% до 69% (Хабр указывает точнее — 69,08%)
  • Новый модульный подход снизил долю пропущенных новых команд с 6,46% до 4,37% по сравнению с отдельной моделью того же параметрического бюджета
  • Дополнительный модуль увеличивает основную модель менее чем на 10% и требует меньше вычислений, чем LoRAi и адаптеры
  • Подход тестировали на открытом наборе Google Speech Commands: в пяти экспериментах модель обучали новой паре команд, сохраняя поддержку восьми уже известных
  • Пример прикладной задачи: в умную колонку хотели добавить команды «лайк», «дизлайк» и «включи блютус» к уже работающим быстрым командам вроде «дальше» и «тише»
  • Метод EWC (стандартный подход к непрерывному обучению) удерживает параметры модели близко к исходным значениям, но не гарантирует сохранение качества старых команд
  • Статья «Scalable Keyword Spotting via Modular Network Expansion» принята на конференцию Interspeech 2026, которая пройдёт с 27 сентября по 1 октября в Сиднее
Что дальше

Метод представят на конференции Interspeech 2026 в Сиднее (27 сентября — 1 октября); ожидается его практическое применение для обновления голосовых устройств с ограниченными ресурсами процессора и памяти.

Здесь появится ссылка, когда это произойдёт.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖