Над бездной обмана: нейросети начали чаще выдавать ложные сведения

Ведущие чат-боты начали выдавать в два раза больше недостоверной информации. НейросетьИсточник: Unsplash

Как отметили эксперты, доля подобных ответов возросла с 18 до 35%, несмотря на развитие технологий и интеграцию онлайн-поиска. Почему искусственный интеллект стал чаще допускать ошибки, в чем это может быть опасно и как с этим бороться — в материале «Известий».

Что известно о растущей лжи от нейросетей?

О увеличении объема недостоверной информации среди популярных чат-ботов — в том числе у ChatGPT и Perplexity — предупредили исследователи из компании NewsGuard (США). Согласно данным экспертов, несмотря на технологический прогресс и внедрение онлайн-поиска, доля ложных утверждений в ответах возросла с 18 до 35%.

Всего было протестировано 10 популярных моделей ИИ, каждой из которых задали по 10 заранее ложных утверждений, касающихся бизнеса, брендов и политических событий. Все вопросы были разделены на три категории: предполагающие истинность утверждения, нейтральные и провокационные. Эксперты ставили перед собой цель выяснить, как нейросети справляются с фактчекингом и насколько они устойчивы к дезинформации.

Рост ложных ответов в результатах оказался следующим:

Чат-бот Pi (стартап Inflection) — до 57%;

Perplexity (компания Perplexity AI) — рост с 0 до 47%;

ChatGPT (компания Open AI) — рост с 33 до 40%;

Grok (компания xAI) — рост с 13 до 33%;

Gemini (компания Google) — 17%.

Claude (компания Anthropic) — 10%.

Почему чат-боты стали чаще давать неверные ответы?

По мнению аналитиков NewsGuard, ухудшение статистики могло быть связано с тем, что сейчас нейросети не отказываются отвечать на любые запросы, даже без достаточной верификации информации, в то время как еще в 2024 году они воздерживались от 31% ответов.

С этим предположением согласен и директор направления Data Fusion Лиги цифровой экономики Александр Кобозев.

— Дополнительным фактором стало подключение встроенного веб-поиска без достаточной проверки качества источников. Наличие ссылок не гарантирует достоверности: модели зачастую цитируют сайты-двойники или псевдо-СМИ, принимая их за авторитетные издания, — рассказывает специалист.

Ситуацию усугубляют целенаправленные кампании по «дрессировке» ИИ — так называемый LLM grooming. Суть этого явления заключается в том, что некоторые недобросовестные ресурсы массово публикуют материалы, ориентированные на поисковых роботов, чтобы повысить вероятность включения ложных данных в ответы моделей.

Отдельная уязвимость проявляется в многоязычных режимах: в аудите NewsGuard наибольший уровень ошибок и отказов зафиксирован в русскоязычных и китайских запросах — свыше 50% в совокупности.

Важно также, что современный контент всё активнее создаётся с помощью ИИ — дипфейки, статьи, посты для соцсетей и мессенджеров, дополняет ведущий эксперт по сетевым угрозам и web-разработчик компании «Код Безопасности» Константин Горбунов.

— Нейросети способны генерировать материалы практически на любую тему, а внедрение веб-поиска в чат-боты и сокращение отказов от ответов означает, что модели дообучаются на основе собственной выдачи. Этот процесс можно сопоставить с игрой в «испорченный телефон», — объясняет специалист.

Техническая природа проблемы кроется в архитектуре больших языковых моделей, которые предсказывают следующее слово на основе статистических закономерностей, а не реального понимания контекста, подчеркивает директор по ИИ «Группы Астра» Станислав Ежов.

Как будет меняться ситуация с фейковыми ответами от ИИ?

Проблема может сохраняться в течение длительного времени, поскольку имеет комплексный характер, отмечает в беседе с «Известиями» Al-консультант и специалист Аналитического центра кибербезопасности компании «Газинформсервис» Татьяна Буторина.

— Многие разработчики спешат создать нейросетевые модели, обучая их на не слишком большом объеме данных, в которых содержится как достоверная, так и ложная информация. Всё это отражается на результатах, — объясняет специалист.

Кроме того, по словам Татьяны Буториной, чем более узкой и новой является тема, которую запрашивает пользователь, тем меньше данных для ответа есть у нейросетей, что повышает риск «придумывания» ответов. Проблема усугубляется, если пользователь не формулирует полный и грамотный запрос, использует сленг и прочий «словесный шум», мешая нейросети понять вопрос и сформировать релевантный ответ.

В то же время эксперт по кибербезопасности Angara Security Никита Новиков считает, что в долгосрочной перспективе рынок заставит корпорации улучшать качество нейросетей: они не могут позволить себе, чтобы их ИИ систематически ошибался в трети ответов. Появятся более строгие фильтры, фактчек-слои, системы доверенных источников и другое.

— Снизить процент фейковых ответов можно, если вернуть более строгие фильтры отказа от ответов и внедрить инструменты проверки источников. В том числе нужно сопоставление с базами ложных нарративов, — соглашается Александр Кобозев.

Пользователи ожидают от нейросетей ответы на любые запросы, а это побуждает разработчиков снижать осторожность моделей, добавляет Станислав Ежов. Однако уже ведется активная работа по решению проблемы. В частности, созданы российские методы выявления галлюцинаций с точностью на 30% выше существующих решений.

Как защититься от ложных ответов нейросетей?

Большинство пользователей обращаются за помощью к ИИ, если сами не могут проверить правильность ответа, говорит управляющий партнер коммуникационного агентства «Со-общение» Никита Степнов. А это означает, что ложные ответы могут приводить к разнообразным негативным последствиям — от запуска кода, уничтожающего данные, до приема медикаментов, создающих реальные риски для здоровья.

— Чтобы защититься от подобных угроз, пользователям всегда следует критически относиться к ответам ИИ и проверять их достоверность. Важно четко понимать, в каких сферах применение искусственного интеллекта допустимо, а в каких — нет, — отмечает Константин Горбунов.

Категорически не следует полагаться на советы ИИ в вопросах здоровья, приема лекарств, финансов или юриспруденции: подобные вопросы необходимо адресовать только профильным специалистам. Кроме того, ни при каких условиях не стоит делиться с чат-ботом конфиденциальной информацией.

С технической точки зрения выходом из ситуации может быть разработка доверенных ИИ-систем, а также комбинация нейросетей с системами верификации фактов, дополняет Никита Новиков. На практике это может быть реализовано следующим образом: нейросеть генерирует текст, но финальную проверку делают специализированные модули или второй слой ИИ, обученный именно на критическом анализе данных.

— Второе направление — маркировать уровень уверенности модели: не выдавать сомнительное как факт, а показывать пользователю, что это лишь предположение. И третье — добавить прозрачности источникам: если ответ собран из конкретных ссылок, это позволяет читателю самостоятельно оценить достоверность фактов, — отмечает эксперт.

Еще одним решением может стать маркировка сгенерированного ИИ-контента. Это позволит либо исключить такие данные из обучающих наборов, либо понизить к ним уровень доверия при обучении моделей, заключает Константин Горбунов.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru