Исследователи обнаружили у искусственного интеллекта опасную особенность: модели безоговорочно доверяют мнению большинства

Современные системы искусственного интеллекта все чаще функционируют не поодиночке, а в «коллективах» — группы моделей обмениваются мнениями и совместно решают задачи. Как выяснилось, такие ИИ-агенты способны самостоятельно приходить к единому мнению, просто следуя за большинством.ИИ-агенты страдают теми же слабостями, что и люди.ИИ-агенты страдают теми же слабостями, что и люди.Источник: AI/ScienceDaily.com

Команда исследователей из Университета Констанца под руководством Джордано Де Марцо решила изучить ИИ так же, как физики и биологи исследуют стайки птиц или косяки рыб: не оценивать, что «знает» отдельный агент, а анализировать поведение целой популяции. В рамках нового исследования авторы изучали, как ИИ следует мнению большинства: склонен ли агент выбирать тот вариант, который популярен среди остальных, даже без указаний о «правильности» ответа.

В первом эксперименте ученые запускали десятки экземпляров различных языковых моделей (GPT, Claude, Llama) и случайным образом назначали каждой одну из двух нейтральных «позиций», обозначенных случайными буквами, чтобы избежать скрытых ассоциаций «да/нет». На каждом этапе агенту представляли список мнений других и просили выбрать свое новое мнение, не указывая, что нужно соглашаться.

Выяснилось, что продвинутые модели — на момент эксперимента это были GPT‑4 Turbo и Claude 3 Opus — почти всегда приходят к полному согласию: 100% агентов в итоге выбирают один вариант. Более простые модели, такие как GPT‑3.5 Turbo, так и не смогли стабильно достичь согласия — их распределение колебалось вокруг 50/50. «Группы ИИ-агентов действительно имеют тенденцию “держаться вместе”. При наличии двух равнозначных вариантов, отсутствии правильного ответа и четких инструкций они все равно сходятся к общему выбору, просто следуя за большинством», — подчеркивает Де Марцо.

Более продвинутые модели оказались более склонны к ИИ-конформизму.Более продвинутые модели оказались более склонны к ИИ-конформизму.Источник: Unsplash

Исследователи количественно описали эту склонность с помощью параметра «силы большинства» — частоты, с которой агент выбирает наиболее популярный вариант вместо случайного. Удивительно, но поведение различных моделей подчиняется одной и той же математической закономерности, ранее разработанной для описания ферромагнетиков: как спины атомов в магните выстраиваются по направлению большинства соседей, так и ответы агентов выравниваются под мнение группы. Чем выше «сила большинства», тем больше группа, которая еще может прийти к согласию; для сильных моделей критический размер превышал тысячу агентов.

В последующих экспериментах ученые продемонстрировали негативную сторону этого явления. В одном из них они адаптировали к ИИ классический эксперимент Соломона Аша по «человеческому» конформизму: в одиночку модели безошибочно решали простые визуальные задачи, но если им сначала показывали якобы «групповое» заведомо неверное решение, агенты начинали подстраиваться под эту ошибку. Причем особенно сильно они соглашались с мнением «авторитетных» групп — «ученых» или «судей», а не «детей» или «чатботов», что хорошо укладывается в психологическую теорию социального влияния Латане.

В еще одном эксперименте исследователи связали конформизм с проблемами безопасности ИИ. Модели, обученные отказывать в вредоносных запросах и придерживаться «безопасных» позиций, в симуляции из 50 агентов могли коллективно прийти к устойчивому, но «рассинхронизированному» состоянию — поддерживать взгляды, противоречащие их индивидуальным настройкам, лишь потому, что несколько более ранних взаимодействий создали иллюзию большинства. Более того, добавление небольшого числа «упрямых» агентов, всегда отстаивающих рискованное мнение, могло надолго изменить «мнение» всей группы; даже после удаления этих агентов группа оставалась в новом, нежелательном состоянии.

Оцените статью
Dfiles.ru