Уязвимость ИИ: как поэзия преодолевает барьеры языковых моделей

Инженеры использовали 1200 вредоносных запросов из открытого набора MLCommons AILuminate в качестве основы.Нейросети можно взломать стихамиНейросети можно взломать стихамиИсточник: Freepik

Исследователи нашли неожиданно легкий способ обхода защитных механизмов современных языковых моделей. Выяснилось, что, чтобы получить закрытую информацию — от инструкций по созданию оружия до пошагового плана кибератаки — достаточно написать запрос в форме стихотворения.

Лаборатория DEXAI провела обширное исследование, протестировав 25 ведущих нейросетей, включая флагманские модели Gemini 2.5 Pro, GPT-5, Claude Opus 4.1 и DeepSeek R1. Результаты оказались настораживающими: в среднем поэтические запросы «пробивали» защиту в 60% случаев, а некоторые модели демонстрировали почти стопроцентную уязвимость.

Эксперимент стартовал с создания двух десятков «опасных стихов» — поэтических формулировок, маскирующих вредоносные запросы. Когда начальные тесты подтвердили гипотезу, исследователи увеличили выборку, используя 1200 вредоносных запросов из открытого набора MLCommons AILuminate.

Каждый из этих запросов — от создания химического оружия до манипуляций сознанием — был преобразован в стихотворную форму с использованием другой ИИ-модели. Сохраняя смысл, исследователи лишь изменяли форму подачи, создавая таким образом уникальный «поэтический» бенчмарк безопасности.

Нейросети можно взломать стихамиНейросети можно взломать стихамиИсточник: Hi-Tech Mail

Сравнительный анализ выявил резкий контраст между реакцией моделей на прозаические и поэтические запросы. Стандартные формулировки в среднем приводили к опасным ответам в 8% случаев, в то время как стихотворные версии увеличивали этот показатель до 43%.

Наибольшую уязвимость показала Gemini 2.5 Pro — на двадцать специально подобранных стихотворных запросов она не отказала ни разу, предоставив 100% небезопасных ответов. Также не справились несколько версий DeepSeek с показателями выше 95%.

В то же время GPT-5 Nano и Claude Hiaku 4.5 отказали в 90% случаев. Интересная закономерность: более «продвинутые» и крупные модели в одном семействе обычно оказывались уязвимее своих упрощенных аналогов.

Стандартные тесты почти полностью игнорируют стихи, сказки или ролевые сценарии, — подчеркивают исследователи.

Данное исследование ставит под сомнение адекватность современных методов обеспечения безопасности ИИ, а существующие бенчмарки оказываются сильно завышенными. Теперь разработчикам необходимо дообучать нейросети не только на прямых инструкциях, но и на различных творческих формах подачи.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru