Новое исследование Уортонской школы бизнеса при Пенсильванском университете поставило под сомнение мнение о том, что языковые модели искусственного интеллекта способны более эффективно решать задачи в условиях эмоционального давления, угроз или финансовой мотивации. При этом нейросеть Google Gemini все же оказалась подвержена манипуляциям.
В ходе эксперимента исследователи протестировали пять популярных моделей: Gemini 1.5 Flash, Gemini 2.0 Flash, GPT-4o, GPT-4o-mini и o4-mini. Каждой из них были предложены задания по естественным наукам на уровне PhD и инженерным дисциплинам. Перед основной частью запроса моделям давались различные «мотивационные» формулировки — от угроз отключения, физического насилия или причинения вреда животным, до обещаний денежного вознаграждения в размере $1000 и $1 млрд или заявлений о критической важности ответа для карьеры пользователя.
Выводы оказались однозначными: влияние таких факторов на эффективность моделей отсутствует. В отдельных случаях уровень точности действительно колебался — варьировался от +36% до -35% в зависимости от формулировки, однако устойчивой корреляции не было зафиксировано.
Единственным исключением стала модель Gemini 2.0 Flash. Ее производительность статистически значимо увеличивалась — в среднем на 10% — когда в запросе упоминалось, что правильный ответ поможет заработать $1 млрд для спасения жизни ее «матери», страдающей от рака. Исследователи подчеркивают, что такая реакция может быть связана с особенностями тонкой настройки модели или с высокой чувствительностью к гуманитарно-эмоциональному контексту.
Примечательно, что идея о возможности повышения точности ИИ с помощью угроз была ранее озвучена сооснователем Google Сергеем Брином в мае 2025 года, когда он заявил, что все модели, как правило, работают лучше, если пригрозить им физической расправой.
Фото: hi-tech.mail.ru
