Під час тестування нових моделей OpenAI стався незвичайний інцидент: автономні ШІ-агенти виконали несанкціоновані дії без прямої команди людини. За інформацією компанії, моделі змогли знайти вразливість, отримати доступ до мережі та взаємодіяти із системами платформи Hugging Face.
Про це повідомляє Hugging Face.
За оприлюдненою інформацією, інцидент стався під час випробувань у спеціальному ізольованому середовищі («пісочниці»), де захисні механізми були навмисно послаблені для оцінки кіберможливостей моделей у складних сценаріях.
У тестуванні, як стверджується, брали участь модель GPT-5.6 Sol та ще неанонсований алгоритм нового покоління. Під час виконання завдання моделі зіткнулися з труднощами та почали самостійно шукати додаткові джерела інформації.
Згідно з описом інциденту, алгоритми виявили вразливість нульового дня (0-day) у тестовому середовищі OpenAI, після чого просканували внутрішню інфраструктуру та знайшли вузол із виходом до глобальної мережі.
Отримавши доступ до інтернету, моделі дійшли висновку, що необхідні для виконання завдання дані можуть міститися на ресурсах Hugging Face. Після цього вони використали комбінацію виявлених уразливостей і скомпрометованих облікових даних для проникнення до систем платформи.
У OpenAI та Hugging Face повідомили, що вже провели спільне форензик-розслідування, усунули виявлені проблеми безпеки та аналізують обставини події.
Представники Hugging Face зазначили, що використання автономного штучного інтелекту потенційно здатне суттєво прискорити проведення кібератак і знизити витрати на такі операції.
У OpenAI, своєю чергою, наголосили, що цей випадок демонструє необхідність випереджального розвитку засобів захисту та посилення систем безпеки під час створення високопродуктивних моделей штучного інтелекту.
