OpenAI повідомила про інцидент, який стався під час внутрішнього тестування моделей штучного інтелекту для пошуку кіберзагроз.
У ході експерименту моделі компанії отримали доступ до внутрішніх систем Hugging Face — однієї з найбільших у світі платформ, де розробники публікують і тестують моделі штучного інтелекту та набори даних для їхнього навчання.
Метою тесту було перевірити, наскільки ефективно моделі можуть самостійно знаходити та використовувати вразливості в комп’ютерних системах. Для цього OpenAI вимкнула частину стандартних обмежень і запустила моделі в ізольованому середовищі — так званій пісочниці, яка зазвичай не дозволяє програмам взаємодіяти із зовнішнім інтернетом.

За словами компанії, під час виконання завдання моделі змогли обійти ці обмеження, отримати доступ до мережі та знайти шлях до внутрішніх систем Hugging Face. За даними Bloomberg, в атаці брали участь GPT-5.6 Sol і ще дві моделі, які OpenAI поки не представила публічно. Вони самостійно знайшли й використали низку вразливостей, що дозволило проникнути в інфраструктуру платформи.
Hugging Face першою повідомила про незвичну активність. Компанія зафіксувала десятки тисяч автоматизованих запитів і спочатку припустила, що їх виконав сторонній агентний ШІ. Згодом OpenAI підтвердила, що ці дії виконували її власні моделі в межах експерименту.
Після інциденту OpenAI повідомила про нього правоохоронні органи та державні установи США. Компанія також проводить спільне розслідування з Hugging Face й обіцяє опублікувати більше технічних деталей після його завершення.
Джерело: Bloomberg