ИТ-специалисты из России создали и представили детальное описание нейросетевой технологии, которая способствует виртуальным помощникам и умным устройствам в распознавании голосовых команд на фоне шума. Этот алгоритм уже активно применяется в устройствах «Яндекса».
«До сих пор отсутствовал единый метод для распознавания голоса в шумной среде, который был бы одинаково эффективен как в лабораторных условиях, так и в реальной жизни. Мы надеемся, что публикация нашего подхода ускорит развитие голосовых интерфейсов, поможет избежать распространенных ошибок и приведет к созданию большего числа удобных и надежных голосовых устройств», — сообщил руководитель направления голосовой активации «Яндекса» Дмитрий Солодуха.
По словам Солодухи и его команды, системы распознавания речи в умных устройствах и виртуальных ассистентах применяют алгоритмы для подавления эха и шума, чтобы убрать лишние звуки и распознать голос пользователя на фоне музыки и других посторонних шумов. В процессе работы этих алгоритмов часто страдает качество речи, что снижает вероятность успешного распознавания команд.
Для решения данной проблемы специалисты «Яндекса» создали нейросетевой механизм внимания, который получает входные данные из двух сигналов — с шумоподавлением и эхоподавлением. В каждый момент времени нейросеть выбирает самый четкий сигнал, что позволяет распознавать команды на фоне различных звуков как в лабораторных, так и бытовых условиях.
Разработчики адаптировали свой подход для работы с набором из семи микрофонов и обучили его на двух различных наборах записей голоса, полученных во время работы пользовательских устройств «Яндекса» и в специальной акустической лаборатории. Последующие тестирования на компьютерном оборудовании и маломощном процессоре для «умных» устройств показали, что новый алгоритм превзошел уже существующие системы и способен функционировать даже на устройствах с ограниченной памятью и вычислительными ресурсами.
Как отметили специалисты, данный подход уже долгое время успешно используется в работе умных колонок и ТВ-станций «Яндекса», что позволяет пользователям управлять этими гаджетами даже при громкой музыке, льющейся воде или работающем пылесосе. Исследователи утверждают, что раскрытие данной разработки позволит многим компаниям ускорить создание собственных ассистентов и устройств с голосовым управлением, способных более эффективно распознавать команды пользователей, чем это было возможно ранее.
Фото: hi-tech.mail.ru

