Как выглядит изображение человека, «ожившее» под влиянием его голоса (видео)

Программа генерирует реалистичные видео с человеком, используя его голос и фотографию.

В 2023 году группа исследователей из NTU Singapore создала компьютерную программу, которая производит видеоролики, отображающие мимику и движения головы говорящего. Для этого необходимы лишь аудиозапись голоса и снимок лица.

DIRFA — это программа, основанная на искусственном интеллекте, которая обрабатывает аудио и фото, а затем формирует 3D-видео. На этих видеоматериалах демонстрируется реалистичная и непрерывная анимация лица, синхронизированная с речью.

Ученые «скормили» ИИ миллион аудио- и видеоклипов.Ученые «скормили» ИИ миллион аудио- и видеоклипов.Источник: YouTube-канал NTUsg

Создание убедительных выражений лица с использованием звука — это непростая задача. Один аудиосигнал может вызывать разные выражения лица. Звук обычно ассоциируется с движениями губ, но менее зависим от других мимических движений и положения головы. Команда стремилась к тому, чтобы движения губ говорящего точно совпадали с произносимым текстом. Лицо должно было отображать эмоции и двигаться естественно.

Чтобы преодолеть эту трудность, команда разработала свою модель искусственного интеллекта DIRFA, которая фиксирует сложные зависимости между звуковыми сигналами и лицевой анимацией. Команда обучила свою модель на более чем миллионе аудио- и видеоклипов, собранных от более 6000 человек из общедоступной базы данных.

<iframe src="https://vk.com/video_ext.php?oid=-48265019&id=456240605&hd=2&autoplay=1&partner_ext=123" width="853" height="480" allow="autoplay; encrypted-media; fullscreen; picture-in-picture;" frameborder="0" allowfullscreen></iframe>

DIRFA смоделировала вероятность лицевой анимации (например, приподнятая бровь или сморщенный нос) на основании входного аудио. Это моделирование позволило программе преобразовывать аудиовход в разнообразные, но очень реалистичные последовательности анимаций лица.

Помимо добавления новых функций и улучшений в интерфейс DIRFA, исследователи будут работать над усовершенствованием выражений лица с использованием более обширных наборов данных с лицами и голосами.

DIRFA может быть применена в различных сферах. В здравоохранении она сможет создавать более сложные и правдоподобные виртуальные помощники и чат-боты, улучшая взаимодействие с пользователем. Программа также может выступать в роли инструмента для людей с нарушениями речи или мимики, помогая им передавать свои мысли и эмоции через выразительные аватары или цифровые изображения, улучшая их способности к общению.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru