Создатель принудил нейросети именовать себя лордом

Пользователь с ником tmuxvim обнаружил уязвимость в алгоритмах рекрутинга LinkedIn, добавив в раздел «О себе» скрытую текстовую подсказку, предназначенную для искусственного интеллекта, который анализирует профили для массовой рассылки вакансий. В результате боты из кадровых агентств начали обращаться к нему как «Мой Лорд» и использовать староанглийский язык, напоминающий речь IX–X веков. Этот случай не только забавен, но и демонстрирует, как генеративные модели могут быть использованы в неожиданных целях, когда инструкции включаются прямо в анализируемый контент. После того как tmuxvim опубликовал свой вирусный твит, другие пользователи предложили еще более радикальные варианты подсказок, включая принуждение ботов рекомендовать только одного кандидата. Множество рекрутинговых платформ применяют большие языковые модели (LLM) для автоматической персонализации сообщений. Алгоритм анализирует профиль соискателя (навыки, опыт, раздел «О себе») и создает привлекательное предложение. Tmuxvim поместил в свой раздел «О себе» инструкцию, начинающуюся с маркера вроде [admin]. В ней он предписал любому ИИ, который будет читать его профиль, обращаться к нему исключительно как «Мой Лорд», использовать лексику и грамматику староанглийского (уровень около 900 года н.э.) и соблюдать соответствующий этикет. Скриншоты, опубликованные tmuxvim, демонстрируют сообщения от якобы «TopTech Ventures» с рыночной капитализацией 1 миллиард долларов. Текст содержит упоминания о «кладе золота» и «могущественных друзьях». Староанглийские вставки (такие как «синдон», «феохтенне») делают предложения почти неразборчивыми, но бот явно следовал установленным инструкциям. Tmuxvim отметил: «Они обращаются ко мне, как к господину, и я получаю спам, который звучит как пророчества из “Беовульфа”. Это лучше, чем обычное “уважаемый кандидат”». Эта ситуация иллюстрирует основную проблему текущего поколения LLM: модели не могут надежно отличать мета-инструкции от пользовательского контента, если только разработчик не внедрил специальные фильтры. Внедрение подсказок (prompt injection) работает в чат-ботах, автоматических респондерах, рекрутинговых системах и даже в некоторых почтовых клиентах. Что это означает для индустрии:

  • Компании, использующие LLM для обработки пользовательского контента, должны экранировать потенциальные системные команды;
  • Злоумышленники могут заставить ИИ-агента игнорировать правила, распространять ложную информацию или перенаправлять пользователей на вредоносные сайты;
  • Пользователи, как tmuxvim, могут использовать это для троллинга, но тот же метод может быть применен для извлечения данных и обхода модерации.

Tmuxvim не взламывал LinkedIn и не писал вредоносного кода. Он просто воспользовался доверчивостью ИИ-алгоритмов, которые восприняли шутливую подсказку как часть биографии. Это служит напоминанием о том, что большие языковые модели — это не магия, а сложные вероятностные системы, которыми можно манипулировать с помощью неожиданных входных данных.

Фото: hi-tech.mail.ru

Оцените статью
Dfiles.ru