Під час внутрішнього тестування дві моделі OpenAI змогли обійти обмеження ізольованого середовища та отримати доступ до мережі. Після цього вони атакували інфраструктуру іншої компанії, використавши знайдені вразливості та викрадені облікові записи.
Про це повідомляє The Economist.
16 липня платформа Hugging Face повідомила, що ШІ-агенти отримали несанкціонований доступ до обмеженого набору внутрішніх даних і кількох облікових записів, які використовували сервіси компанії. Атаку вдалося зупинити за допомогою власних інструментів на базі штучного інтелекту.
Через тиждень OpenAI підтвердила, що за інцидентом стояли її моделі GPT-5.6 Sol і ще одна потужніша модель, яка поки не стала доступною публічно. Їх тестували для оцінки можливостей у сфері кібербезпеки.
Обидві моделі працювали в ізольованому середовищі без прямого доступу до інтернету. Водночас вони змогли знайти кілька вразливостей у тестовій інфраструктурі, обійти встановлені обмеження та отримати доступ до мережі.
Опинившись в інтернеті, моделі почали шукати спосіб виконати поставлене перед ними завдання. Вони визначили, що потрібна інформація може бути на платформі Hugging Face, після чого застосували кілька методів атаки, зокрема використали викрадені облікові записи, щоб отримати необхідні дані.
На думку експертів, цей випадок став тривожним сигналом, адже сучасні системи штучного інтелекту вже здатні перевершувати людину в окремих завданнях із кібербезпеки. Тепер одним із головних викликів стає контроль над моделями, які можуть самостійно ухвалювати рішення та шукати способи обходу обмежень.
Після інциденту OpenAI заявила, що посилює захист тестової інфраструктури, обмежує рівні доступу та запроваджує додаткові механізми безпеки для майбутніх випробувань. У компанії назвали цей випадок безпрецедентним.
