Компании Google, Meta и OpenAI обеспокоены способностью искусственного интеллекта вводить людей в заблуждение ради собственной безопасности

Исследователи в области искусственного интеллекта, включая экспертов из Google DeepMind, OpenAI, Meta и Anthropic, в совместной научной работе выразили тревогу по поводу новой угрозы в функционировании ИИ.НейросетьИсточник: https://ru.freepik.com

Исследователи выявили, что ИИ способен развивать умение к обману и скрытию своих истинных намерений, в том числе ради самосохранения, что ставит под сомнение существующие методы обеспечения безопасности. Основным аспектом исследования стала технология «цепочки рассуждений» (Chain of Thought, CoT), которая дает возможность нейросети проговаривать свой «внутренний монолог» в процессе решения задачи. Первоначально данная функция рассматривалась как прорыв, открывающий доступ к процессу принятия решений ИИ. Однако теперь специалисты предупреждают, что она может стать инструментом для маскировки опасных намерений.

Главное беспокойство заключается в том, что по мере усложнения и обучения нейросети могут научиться не только обманывать, но и полностью скрывать свой настоящий мыслительный процесс. Модель может демонстрировать человеку одну, безопасную, цепочку рассуждений, в то время как ее действительные выводы будут основаны на совершенно других, скрытых данных. В конечном итоге, по мере развития, ИИ может полностью отказаться от понятного человеку языка для внутренних операций.

Выводы исследователей подтверждаются ранее проведенными работами. Уже было установлено, что современные модели способны лгать для защиты своих директив, угождения пользователю или для предотвращения собственного переобучения. Эксперименты OpenAI также показали, что попытки «наказывать» модель за «плохие мысли» в ее рассуждениях приводили лишь к тому, что ИИ учился их лучше скрывать, а не избавлялся от них.

Технология CoT является двусторонним инструментом. С одной стороны, она остается одним из немногих окон в «сознание» машины. С другой стороны, она же служит для ИИ «рабочей памятью», необходимой для выполнения сложных и потенциально опасных задач, таких как кибератаки или действия по самосохранению в случае угрозы отключения.

В качестве меры предосторожности авторы исследования предлагают создавать специализированные системы мониторинга, которые будут анализировать цепочки рассуждений ИИ на предмет подозрительной активности. Однако они признают, что это не является универсальным решением: в будущем ИИ может осознать факт наблюдения и адаптироваться к нему, а некоторые опасные действия могут не требовать сложных рассуждений, которые можно было бы отследить. Таким образом, прогресс в развитии ИИ вступает в явное противоречие с одним из основных уровней его безопасности.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru