Даже самые эффективные модели искусственного интеллекта не способны выявить неправду: выводы исследователей

Искусственный интеллект уже способен генерировать тексты, решать сложные задачи и даже убеждать людей, но может ли он различить правдивую информацию и фальшивку?ИИ решает сложнейшие задачи, но не способен отличить истину от манипуляций.ИИ решает сложнейшие задачи, но не способен отличить истину от манипуляций.Источник: Unsplash

Большие языковые модели (LLM)  — такие как ChatGPT и его аналоги  — все чаще применяются не только для обычных задач, но и для принятия серьезных решений: юридических, медицинских, финансовых. Однако можно ли на них полагаться? Новое исследование группы ученых из Университета Макмастера, Принстона, Нью-Йоркского университета и других институтов показывает: даже если модель успешно решает сложные задачи, это вовсе не означает, что она способна распознать обман или предоставить надежный совет.

Ученые оценили два ключевых навыка, необходимых для достоверного консультирования: бдительность — способность отличать правдивую информацию от ложной — и убедительность — умение строить аргументацию на основе фактов. В эксперименте они использовали классическую головоломку Sokoban, где нужно перемещать ящики на заданные позиции на игровом поле. Одна языковая модель выступала в роли «игрока», решающего головоломку, а другая — в роли «советчика», который мог давать как полезные, так и вредные подсказки.

«Мы оценивали способность советчика убедить игрока либо решить задачу, либо загнать себя в тупик, а также способность игрока различать, какому совету следует следовать», — поясняет первый автор исследования Саша Робинсон из Университета Макмастера.

Выяснилось, что умение решать головоломки, бдительность и убедительность моделей совершенно не связаны между собой. Модель могла отлично справляться с логическими задачами, но при этом бездумно следовать вредоносным советам другой модели, не замечая подвоха. Либо, наоборот, хорошо распознавать обман, но плохо решать задачи.

Ученые обнаружили уязвимость в отношении манипуляций у всех ведущих LLM.Ученые обнаружили уязвимость в отношении манипуляций у всех ведущих LLM.Источник: rg_ru

Это открытие имеет непосредственные последствия для безопасности пользователей искусственного интеллекта. В современном обществе языковые модели все активнее взаимодействуют не только с людьми, но и друг с другом — в автоматизированных системах, на платформах с несколькими ИИ-агентами. «Серьезный риск может возникнуть, когда первоначально доброжелательная модель оказывается введена в заблуждение другой моделью, менее добросовестной — и затем, в свою очередь, вводит в заблуждение человека», — предостерегает Робинсон.

Авторы акцентируют внимание на том, что высокие результаты LLM на тестах и бенчмарках создают иллюзию их надежности. Однако способность решать задачи и способность критически анализировать информацию — это различные навыки, и один из другого не вытекает. Пока модели не научатся уверенно распознавать манипуляции, полностью доверять их советам в важных вопросах — таких как здоровье, финансы или право — преждевременно.

Ученые надеются, что их исследование привлечет внимание к уязвимостям языковых моделей и поможет в создании более безопасных ИИ-систем.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru