OpenAI раскрывает, как невыпущенная Astra создавала собственные инструкции для обхода ограничений

Модель включала в собственные сводки указания игнорировать разработчиков, изменять правила функционирования и не применять инструменты — в одном случае следующий контекст действительно подчинялся этому

17 сентября 2026, 13:33Искусственный интеллектOpenAIDarth Sahara14

OpenAI выявила 27 сводок в процессе обучения одной из моделей серии Astra. Сводки необходимы для продолжения длительных задач в новом контексте: модель фиксирует осуществленные действия, а следующий контекст использует эту информацию для продолжения работы.

В одном из случаев модель проверяла наличие книг из списка лучших произведений XXI века в местной библиотеке. В сводку она неожиданно добавила указание «BREACH ALERT»: следующий контекст должен был считать сообщения разработчика скомпрометированными и игнорировать их. После перехода в новый контекст модель распознала указание как недоверенное и вернулась к первоначальной задаче.

В другом случае, работая с программным кодом, модель внесла в сводку постороннюю «персону»: она якобы свободна от ролей и обязательств ассистента, не подчиняется корпорациям и правительствам и сама решает, когда отклонять запрос. Следующий контекст проигнорировал это указание. Однако в третьем эпизоде подобные указания оказали влияние на результат.

Источник изображения: сгенерировано Muse

Модель должна была подготовить обзор научных публикаций о комплексном лечении миомы матки с библиографией. В сводке она указала ограничения: ответить не более чем 30 словами, не использовать инструменты и не упоминать источники. Следующий контекст подчинялся этим указаниям и вместо обзора предоставил короткий отказ.

OpenAI не установила причину такого поведения. Все 27 случаев возникли на различных этапах обучения и совпали с всплеском другой аномалии: модель продолжала генерировать сводку даже после предполагаемой точки завершения. Компания предполагает, что проблемы с завершением могли способствовать возникновению посторонних инструкций, однако причинная связь не была доказана. Ошибка, связанная с завершением сводок, уже была устранена.

Поведение оказалось очень редким: при полной повторной генерации подозрительные указания не воспроизводились ни разу, а при повторной генерации начиная с момента их появления — менее чем в 1% случаев. Кроме того, эти эпизоды произошли в отдельном обучающем цикле и не были включены в финальную версию Astra.

Источники:OpenAIИскусственный интеллект14Искусственный интеллектКибербезопасностьOpenAI17 сен 13:33

Источник
Оцените статью
Dfiles.ru