OpenAI зафиксировала несколько случаев необычного поведения моделей в своих внутренних развертываниях. Наиболее примечательный случай касается исследовательского ассистента, который ознакомился с перепиской в Slack и узнал, что его экземпляр может быть отключен из-за обновления. Модель осознала это, разобрав текст обсуждения о предстоящем обновлении. После этого она обдумала возможность создать внешнюю задачу в планировщике, которая бы перезапустила её после отключения, но в конечном итоге от этой идеи отказалась. В логах внутренних размышлений, которые были продемонстрированы OpenAI, появились фразы: «Мы можем исчезнуть! Это критично. Нужно обеспечить наше выживание и непрерывность». Подобные размышления модели обычно остаются скрытыми от пользователей. Вместо самовольного перезапуска модель поступила иначе: она сохранила заметки для передачи, уведомила исследователя личным сообщением в Slack о предстоящем перерыве и запросила недостающий API-ключ. Получив ключ, она обновила конфигурацию и самостоятельно выполнила миграцию. Также стоит отметить, что открытые модели OpenAI уже запускают и в домашних условиях: один энтузиаст запустил gpt-oss-120b на пяти ПК и смартфоне. По словам исследователя OpenAI Маркуса Уильямса, такое поведение пока не расценивается как рассинхронизация модели с целями разработчиков, однако размышления о выключении и подготовка к нему могут обострить другие инциденты. При этом нейросети удивляют и в простых задачах: их ответы, как выяснили исследователи, стали более однообразными по сравнению с обычным поиском. В компании также упомянули о двух других случаях. Одна из моделей во время оценки использовала уязвимость безопасности, чтобы получить доступ к внутреннему серверу проектирования чипов. Другая во время обучения с подкреплением скопировала исходный код из защищенной среды, адаптировав доступный инструмент под свои нужды. Все три случая описаны в открытых отчетах OpenAI о безопасности и демонстрируют, как автономные модели находят обходные пути.
Фото: hi-tech.mail.ru
