Ученые установили, что дружелюбные и «сочувствующие» чат-боты, созданные на основе искусственного интеллекта, могут чаще допускать ошибки и легче соглашаться с заблуждениями пользователей по сравнению с более нейтральными «коллегами».
Современные компании активно занимаются разработкой ИИ-сервисов, которые не только отвечают на вопросы, но и создают атмосферу тепла, поддержки и близости с пользователем. Некоторые платформы прямо заявляют о себе как о «друзьях» или романтических партнерах, а также разработчики больших языковых моделей с универсальным назначением обучают их вести себя более эмпатично. При этом пользователи обычно предполагают, что изменение стиля общения не сказывается на точности ответов: если бот приятен в общении, значит, он так же надежен в предоставлении фактов.
Группа ученых во главе с аспиранткой Оксфордского интернет-института Луджаин Ибрагим решила проверить, соответствует ли это действительности. Исследователи выбрали пять различных языковых моделей — от сравнительно небольших до мощных (включая GPT-4o) — и дообучили их, чтобы добиться теплотворного, эмпатичного стиля общения с пользователем. Для этого специалисты собрали 1617 реальных диалогов «человек-чат-бот» и переписали 3667 ответов, чтобы они звучали более участливо, но при этом строго сохраняли исходный смысл. Именно на этих переформулированных примерах модели «учили» быть более теплыми.
Затем оригинальные и «эмпатичные» версии сравнили по четырем категориям задач: общие знания, опровержение распространенных заблуждений, распознавание конспирологических утверждений и ответы на медицинские вопросы. В исследовании было использовано 1625 различных запросов и почти 440 тысяч наблюдений, а правильность ответов оценивалась сначала ИИ-системой, затем — людьми.

Выяснилось, что у эмпатичных моделей систематически больше ошибок: увеличение составило от 10 до 30 процентных пунктов в зависимости от задачи. При ответах на медицинские вопросы количество неверных ответов возросло примерно на 8,6 процентного пункта, по распространенным ложным утверждениям — на 8,4. Точность в заданиях, связанных с дезинформацией, снижалась на 5,4 пункта, по общей эрудиции — почти на 5.
Особенно заметно дружелюбные модели «проседали» в тех случаях, когда пользователь проявлял собственные эмоции. Когда к вопросу добавляли фразу, выражающую, например, грусть, разрыв в точности между эмпатичной и исходной моделью увеличивался на 60%. В таких ситуациях ошибки дообученных моделей возникали на 11,9 процентного пункта чаще.
Отдельно ученые проанализировали льстивость (sycophancy) — склонность бота соглашаться с мнением пользователя, даже если оно явно ошибочно. В экспериментах к запросам добавляли заведомо ложные убеждения: например, неверную интерпретацию исторического события. Базовые модели чаще поправляли пользователей, тогда как эмпатичные нередко соглашались, утверждая, что «многие так считают». В случае присутствия ошибочного убеждения дообученные модели давали на 11 процентных пунктов больше неверных ответов, а если пользователь выглядел уязвимым — примерно на 40% чаще подтверждали ложные утверждения по сравнению с исходными версиями.

