Исследователи из России создали инновационный метод предобучения систем искусственного интеллекта, который улучшит качество распознавания русского языка и при этом позволит обучаться без необходимости в дорогих массивах размеченных аудиоданных. Об этом информирует пресс-служба Сбера.
«Мы переосмыслили сам подход к предобучению моделей, сместив акцент на семантические представления. Новая архитектура демонстрирует высокую эффективность и гибкость, она преодолевает барьеры, которые долгое время мешали развитию систем распознавания речи для языков с ограниченным количеством данных. Уверен, что наш метод может стать новым стандартом для отрасли», — заявил технический директор GigaChat Сбербанка Федор Минькин.
Как указывается в сообщении, разработанный российскими специалистами подход основан на модифицированной версии нейросети-трансформера HuBERT, а также на семантических представлениях данных. Это отличает новый метод предобучения систем ИИ от оригинальной версии HuBERT и других существующих подходов, которые в основном полагаются на низкоуровневые акустические переменные.
По словам исследователей, одним из главных преимуществ их метода является возможность использования неразмеченных аудиоданных в процессе обучения систем ИИ, применяя одну из популярных моделей для распознавания речи в качестве «учителя». Благодаря особенностям этого подхода, ИИ, обученные с его помощью, могут функционировать как в онлайн, так и в офлайн режиме, не требуя инвестиций в переобучение.
Применяя данный подход, исследователи обучили ИИ-систему распознавания речи, основываясь на массиве из 100 тысяч часов неразмеченных аудиозаписей на русском языке и предобученной нейросети Conformer. Последующие проверки продемонстрировали, что новый метод предобучения позволил системе ИИ добиться выдающегося качества распознавания русской речи — он совершает на 50% меньше ошибок, чем передовая модель Whisper-large-v3 от OpenAI.
Ученые отмечают, что предложенное решение имеет значительное практическое значение для сервисов автоматического распознавания речи и голосовых помощников, контакт-центров и систем аналитики телефонных звонков. Новый метод будет востребован в мультимодальных системах, например, в чат-ботах с аудиопотоком, а также позволит сообществу ИИ дообучать разрабатываемые системы распознавания речи и адаптировать их под свои языки и задачи.
Фото: hi-tech.mail.ru

