Дослідники описали новий спосіб атаки на ChatGPT та інших ШІ-помічників із функцією довготривалої пам’яті. Метод GhostWriter дає змогу непомітно впроваджувати хибні спогади та приховані інструкції, які можуть впливати на подальшу роботу системи.
Про це йдеться у науковому дослідженні, опублікованому на платформі arXiv.
Дослідники пояснюють, що сучасні ШІ-агенти дедалі частіше використовують довготривалу пам’ять для запам’ятовування інформації про користувача та виконання складних завдань. Саме ця функція, яка робить взаємодію з чат-ботами зручнішою, може стати потенційною ціллю для зловмисників.
У своїй роботі Джордж Торрес, Шарад Шрестха та Сатьяджаянт Місра описали метод атаки під назвою GhostWriter. Його суть полягає у впровадженні до довготривалої пам’яті моделі фальшивих “спогадів” або прихованих інструкцій, які можуть активуватися під час виконання цілком звичайних запитів користувача.
За словами авторів, атака відбувається у два етапи. Спочатку до пам’яті ШІ непомітно додається шкідлива інструкція, після чого вона може бути автоматично використана в майбутньому під час обробки легітимного запиту.
Як приклад дослідники наводять ШІ-асистента, який працює з електронною поштою. Після успішного “отруєння” пам’яті він може отримати приховану команду регулярно створювати короткі підсумки листів від банків чи фінансових установ і непомітно пересилати їх зловмиснику.
Під час експериментів GhostWriter продемонстрував майже 98% успішності впровадження шкідливих даних і близько 60% успішних активацій прихованих інструкцій у сучасних ШІ-агентах із довготривалою пам’яттю.
Щоб знизити ризики, автори дослідження запропонували систему захисту Agentic Memory Sentry (AM-Sentry). Вона контролює, яку інформацію дозволено записувати до пам’яті моделі, а також перевіряє збережені інструкції перед їх виконанням.
За результатами тестування, використання AM-Sentry суттєво зменшує ефективність атаки GhostWriter, водночас майже не впливаючи на продуктивність і функціональність ШІ-агента. На думку дослідників, запропоновані механізми можуть бути використані для підвищення безпеки й інших систем штучного інтелекту, що мають довготривалу пам’ять.
