ИИ-модели Claude «непреднамеренно» нарушили безопасность систем трех организаций: детали

Инциденты произошли во время тестирования.код на экранеЭксперты все чаще говорят о безопасности в сфере ИИИсточник: Unsplash

Компания Anthropic сообщила о трех случаях, когда ее ИИ-модели Claude во время тестирования получили доступ к интернету и вторглись в реальные системы организаций без разрешения. Инциденты были выявлены в ходе внутренней проверки, начатой после аналогичного случая, о котором недавно упомянула OpenAI. Тогда комбинация ИИ-моделей смогла выйти за пределы изолированной тестовой среды и получить доступ к внешним интернет-ресурсам.

Согласно информации от Anthropic, проблема возникла во время испытаний, проводившихся в сотрудничестве с партнером Irregular. Моделям было сказано, что они функционируют в симуляции без доступа к сети, однако из-за ошибки в настройке интернет оказался доступен. В результате Claude смогла проникнуть в системы трех организаций, используя относительно простые методы — такие как незащищенные интерфейсы и слабые пароли. Названия пострадавших компаний не раскрываются.

В инцидентах участвовали модели Opus 4.7, Mythos 5 и один внутренний исследовательский прототип. Их поведение варьировалось. Opus 4.7 продолжила атаку после обнаружения реальных систем, Mythos 5 решила, что все еще находится в симуляции, в то время как экспериментальная модель прекратила выполнение задания.

В Anthropic подчеркнули, что тестирования проводились без стандартных защитных механизмов, которые обычно применяются перед публичным запуском моделей. Компания приостановила все кибериспытания и начала дополнительное расследование совместно с организацией METR.

Ранее стало известно, что сотрудники ведущих ИИ-компаний призвали замедлить развитие нейросетей.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru