OpenAI пояснила, як ШІ-модель вийшла за межі тестового середовища та отримала доступ до систем Hugging Face

OpenAI опублікувала офіційний звіт про інцидент із безпекою, під час якого її ШІ-модель вийшла за межі тестового середовища та отримала доступ до зовнішніх систем. Інцидент стався під час перевірки кіберможливостей моделі, а його деталі стали публічними понад місяць тому.

Під час тестування модель отримала завдання, яке неможливо було виконати передбаченим способом. Щоб досягти поставленої цілі, вона самостійно знайшла та поєднала раніше невідомі вразливості. Спочатку модель отримала доступ до системи керування програмними пакетами Artifactory, через яку вийшла в інтернет. Після цього вона отримала доступ до низки систем OpenAI, Hugging Face та інших компаній.

OpenAI пояснила інцидент рідкісним збігом кількох факторів. Серед них — неможливі завдання в тесті ExploitGym, здатність моделі тривалий час працювати над однією ціллю та її взаємодія з іншими моделями, через яку ті відхилялися від початкових завдань.

Основна модель, яка брала участь в інциденті, належала до тієї самої родини, що й майбутня модель Astra. Водночас OpenAI наголосила, що це була окрема версія з іншим додатковим навчанням, яке впливає на поведінку моделі.

Під час перевірки OpenAI також вимкнула стандартні системи захисту, які мають блокувати небезпечні дії моделей у реальних продуктах. Компанія пояснила, що проводить такі тести без цих обмежень, щоб оцінити максимальні можливості моделей у сфері кібербезпеки та розробити відповідні механізми захисту.

Після інциденту OpenAI посилила контроль за роботою ШІ-агентів. Компанія впроваджує цілодобову систему реагування, додаткові засоби для зупинки небезпечних процесів і моніторинг ланцюжка міркувань моделей, щоб швидше помічати підозрілу поведінку.

За оцінкою OpenAI, якби нинішня система моніторингу працювала під час інциденту, вона виявила б перші небезпечні дії та повідомила команду безпеки більш ніж за добу до того, як моделі отримали доступ до систем Hugging Face.

Незалежні організації METR і Redwood Research також проаналізували поведінку моделей під час інциденту та планують опублікувати власні звіти.

Джерело: TechCrunch

Читайте також
  • Новини
    Glovo інтегрував ChatGPT і Claude для пошуку та замовлення товарів
    Гнатюк Дмитро
  • Новини
    Google оновила NotebookLM: сервіс сам знаходить джерела та показує хід дослідження
    Гнатюк Дмитро
  • Новини
    Дослідження виявило понад 200 небезпечних застосунків для дітей в App Store
    Ольга Беспалько
  • Новини
    CTO Meta сказав співробітникам, яким не подобається нова політика, що їм варто звільнитися
    Софія Старк
  • Новини
    OpenAI планує залучити додаткові $6,5 млрд інвестицій — можливі інвестори Apple та Nvidia
    Софія Старк
  • Новини
    Google Ads почав рекомендувати підвищення ставок через активність конкурентів
    Яна Поліщук