Искусственный интеллект уже способен генерировать тексты, решать сложные задачи и даже убеждать людей, но может ли он различить правдивую информацию и фальшивку?
Большие языковые модели (LLM) — такие как ChatGPT и его аналоги — все чаще применяются не только для обычных задач, но и для принятия серьезных решений: юридических, медицинских, финансовых. Однако можно ли на них полагаться? Новое исследование группы ученых из Университета Макмастера, Принстона, Нью-Йоркского университета и других институтов показывает: даже если модель успешно решает сложные задачи, это вовсе не означает, что она способна распознать обман или предоставить надежный совет.
Ученые оценили два ключевых навыка, необходимых для достоверного консультирования: бдительность — способность отличать правдивую информацию от ложной — и убедительность — умение строить аргументацию на основе фактов. В эксперименте они использовали классическую головоломку Sokoban, где нужно перемещать ящики на заданные позиции на игровом поле. Одна языковая модель выступала в роли «игрока», решающего головоломку, а другая — в роли «советчика», который мог давать как полезные, так и вредные подсказки.
«Мы оценивали способность советчика убедить игрока либо решить задачу, либо загнать себя в тупик, а также способность игрока различать, какому совету следует следовать», — поясняет первый автор исследования Саша Робинсон из Университета Макмастера.
Выяснилось, что умение решать головоломки, бдительность и убедительность моделей совершенно не связаны между собой. Модель могла отлично справляться с логическими задачами, но при этом бездумно следовать вредоносным советам другой модели, не замечая подвоха. Либо, наоборот, хорошо распознавать обман, но плохо решать задачи.

Это открытие имеет непосредственные последствия для безопасности пользователей искусственного интеллекта. В современном обществе языковые модели все активнее взаимодействуют не только с людьми, но и друг с другом — в автоматизированных системах, на платформах с несколькими ИИ-агентами. «Серьезный риск может возникнуть, когда первоначально доброжелательная модель оказывается введена в заблуждение другой моделью, менее добросовестной — и затем, в свою очередь, вводит в заблуждение человека», — предостерегает Робинсон.
Авторы акцентируют внимание на том, что высокие результаты LLM на тестах и бенчмарках создают иллюзию их надежности. Однако способность решать задачи и способность критически анализировать информацию — это различные навыки, и один из другого не вытекает. Пока модели не научатся уверенно распознавать манипуляции, полностью доверять их советам в важных вопросах — таких как здоровье, финансы или право — преждевременно.
Ученые надеются, что их исследование привлечет внимание к уязвимостям языковых моделей и поможет в создании более безопасных ИИ-систем.
Фото: hi-tech.mail.ru

