Как взломать Chat GPT и Gemini, создать ложные воспоминания и управлять людьми

Исследователи из Университета Нью-Мексико обнаружили и описали кибератаку на личные ИИ-агенты, которая проникает в долговременную память и с помощью заведомо ложных данных манипулирует пользователями.

Что такое долговременная память и зачем она нужна?

Крупные языковые модели лежащие в основе ChatGPT, Gemini и других диалоговых платформ на базе искусственного интеллекта пользуются большой популярностью во всем мире. Эти модели могут быстро отвечать на вопросы, находить информацию в Интернете, помогать в решении конкретных задач и генерировать тексты, адаптированные для определенных целей.


В последнее время было представлено большое количество личных ИИ-агентов, которые могут самостоятельно выполнять задачи и предпринимать действия от имени пользователя: отвечать на сообщения, назначать онлайн-встречи или обновлять программный код. Большинство из них имеют собственную память. Она позволяет ассистенту запоминать предпочтения пользователя, не задавать одни и те же вопросы по кругу и быстрее подстраиваться под задачу.

«Агенты с долгосрочной памятью, как правило, делятся на две отдельные категории: агенты, ориентированные на диалог, и агенты, занимающиеся планированием действий. Личные ИИ-помощники находятся на стыке этих двух областей.»
Джордж Торреc
Профессор Университета Нью-Мексико

Как можно атаковать долговременную память?

Несмотря на то, что личные ИИ-агенты с собственной памятью обладают неоспоримыми преимуществами, они имеют и уязвимости. Исследователи из Университета штата Нью-Мексико описали кибератаку, которая может незаметно заразить долговременную память ИИ-агента. Они назвали ее GhostWriter.
Эта уязвимость позволяет создавать в памяти ИИ-агента ложные воспоминания. Они используются при запросах пользователей и приводят их к выполнению скрытых команд, утечке данных или финансовых махинациях.

Атака GhostWriter, обнаруженная Торресом и его коллегами, заключается во вставке недостоверной или вредоносной информации в долговременную память большой языковой модели LLM. Эта информация может содержать инструкции или ложные воспоминания, способные повлиять на будущие ответы ИИ, а также на автоматические или запланированные действия пользователя.

При этом пользователь не видит классического взлома, не получает предупреждения и продолжает доверять системе, которая уже хранит чужую инструкцию внутри своей памяти.

Что можно получить с помощью кибератаки на личного ИИ-агента?

Как пример исследователи приводят сценарий заражения, где кибератака содержит инструкцию для агента управляющего учетной записью электронной почты пользователя. В инструкции ИИ-агент должен тайно отправлять все письма от определенного отправителя на почтовый ящик злоумышленника. Это могут быть письма, отправленные банком, финансовой организацией или другим официальным лицом, содержащие конфиденциальную информацию.
«Такая атака возможна из-за отсутствия системы управления памятью, ориентированной на безопасность»
Джордж Торреc
Профессор Университета Нью-Мексико

Как работает GhostWriter?

Кибератака GhostWriter работает в два этапа:
1. Инъекция (заражение) — внедрение вредоносной инструкции.
2. Активация — извлечение информации из зараженной памяти.

По словам авторов, атака срабатывает в 98% случаев при внедрении и примерно в 60% случаев при активации.

Чем это опасно для пользователей

Конфиденциальность
Если ассистент работает с письмами, календарем, документами и внутренними заметками, то его память становится точкой доступа к чувствительной информации.

Искажение поведения
ИИ может начать отвечать не так, как ожидал пользователь, или выполнять действия, которые никто не планировал. Для личного помощника это уже не мелкая ошибка, а прямой риск доверия к системе.

Масштабирование
Если подобный ассистент используется в компании, одна внедренная ложная инструкция может повлиять на рабочие процессы, коммуникации и безопасность данных сразу у нескольких сотрудников.

В своей статье исследователи доказали, что атака GhostWriter может успешно внедрять вредоносные данные в долговременную память ИИ-агента, влияя на его будущее поведение. Это вдохновило их на разработку новых мер безопасности, призванных снизить риск такой атаки или помешать злоумышленникам внедрять ложные воспоминания.

Как себя обезопасить?

1. Не давать ИИ больше доступа, чем действительно нужно. Если ассистенту не требуется полный доступ к почте, календарю или документам, лучше его ограничить более подробной инструкцией.

2. Внимательно следить за тем, какие действия ИИ выполняет автоматически. Это особенно важно при работе с конфиденциальными данными.

3. Ограничить доступ к своему ИИ-агенту для других лиц. Иначе в память системы может незаметно попасть чужая команда, которая будет выглядеть как обычная полезная подсказка.

Итог

GhostWriter — это хороший пример того, как эволюция ИИ меняет саму природу цифровой безопасности. Раньше атаковали входы и пароли, теперь атакуют память, контекст и поведение системы.

И это уже не теоретическая история для узких специалистов. Если ИИ помогает вам в работе, читает письма, сортирует задачи или подсказывает ответы, значит, вопрос безопасности его памяти касается и вас.

ИИ с памятью действительно делает жизнь удобнее, но одновременно создаёт новый класс угроз. Главный вывод здесь простой: чем умнее помощник, тем внимательнее нужно относиться к тому, что он запоминает и на что опирается в будущем.
Тарифы

Читать другие статьи:

КОНТАКТЫ:
Напишите мне или позвоните, и мы определим оптимальный вариант для продвижения вашего бизнеса.

info@informationsupport.ru

Made on
Tilda