Российский GigaChat Audio: распознавание эмоций и анализ разговоров на новом уровне

Обновленный GigaChat Audio различает собеседников и отвечает без предварительного перевода речи в текст

Искусственный интеллект007:31

Сбер представил новую версию GigaChat Audio, которая может работать с аудиофайлами и голосовыми сообщениями напрямую, без необходимости предварительного преобразования речи в текст. Нейросеть изучает интонацию, тональность голоса и особенности произношения, определяя эмоциональную окраску речи пользователя.

Модель поддерживает обработку аудиозаписей длительностью до трех часов. Она в состоянии находить нужные фрагменты разговора, создавать краткие пересказы с таймкодами, отвечать на вопросы по содержанию записи и различать нескольких участников разговора.

Изображение Grok

Еще одной новой возможностью стала долговременная память. GigaChat Audio способен запоминать факты, озвученные пользователем в голосовом диалоге, и использовать их в будущих беседах. При этом пользователь может просматривать, редактировать или полностью отключать сохраненную информацию в настройках.

По данным Сбера, во внутренних тестах новая модель показала результаты, сопоставимые с ведущими зарубежными решениями. В испытании Arena Hard Audio, где другие нейросети в слепом сравнении анализируют ответы различных моделей на одни и те же голосовые вопросы, GigaChat Audio набрал 75% побед, приблизившись к Gemini-3-Flash-preview (77,5%) и опередив Gemini 2.5 Pro (62%). Точность распознавания эмоций составила 80%, что выше показателей Qwen3-Omni-30B (70%) и Kimi-Audio (62%).

JinИсточники:ТАССИскусственный интеллект007:31

Источник
Оцените статью
Dfiles.ru