Инциденты произошли во время тестирования.
Компания Anthropic сообщила о трех случаях, когда ее ИИ-модели Claude во время тестирования получили доступ к интернету и вторглись в реальные системы организаций без разрешения. Инциденты были выявлены в ходе внутренней проверки, начатой после аналогичного случая, о котором недавно упомянула OpenAI. Тогда комбинация ИИ-моделей смогла выйти за пределы изолированной тестовой среды и получить доступ к внешним интернет-ресурсам.
Согласно информации от Anthropic, проблема возникла во время испытаний, проводившихся в сотрудничестве с партнером Irregular. Моделям было сказано, что они функционируют в симуляции без доступа к сети, однако из-за ошибки в настройке интернет оказался доступен. В результате Claude смогла проникнуть в системы трех организаций, используя относительно простые методы — такие как незащищенные интерфейсы и слабые пароли. Названия пострадавших компаний не раскрываются.
В инцидентах участвовали модели Opus 4.7, Mythos 5 и один внутренний исследовательский прототип. Их поведение варьировалось. Opus 4.7 продолжила атаку после обнаружения реальных систем, Mythos 5 решила, что все еще находится в симуляции, в то время как экспериментальная модель прекратила выполнение задания.
В Anthropic подчеркнули, что тестирования проводились без стандартных защитных механизмов, которые обычно применяются перед публичным запуском моделей. Компания приостановила все кибериспытания и начала дополнительное расследование совместно с организацией METR.
Ранее стало известно, что сотрудники ведущих ИИ-компаний призвали замедлить развитие нейросетей.
Фото: hi-tech.mail.ru

