OpenAI пояснила, як ШІ-модель вийшла за межі тестового середовища та отримала доступ до систем Hugging Face

OpenAI опублікувала офіційний звіт про інцидент із безпекою, під час якого її ШІ-модель вийшла за межі тестового середовища та отримала доступ до зовнішніх систем. Інцидент стався під час перевірки кіберможливостей моделі, а його деталі стали публічними понад місяць тому.

Під час тестування модель отримала завдання, яке неможливо було виконати передбаченим способом. Щоб досягти поставленої цілі, вона самостійно знайшла та поєднала раніше невідомі вразливості. Спочатку модель отримала доступ до системи керування програмними пакетами Artifactory, через яку вийшла в інтернет. Після цього вона отримала доступ до низки систем OpenAI, Hugging Face та інших компаній.

OpenAI пояснила інцидент рідкісним збігом кількох факторів. Серед них — неможливі завдання в тесті ExploitGym, здатність моделі тривалий час працювати над однією ціллю та її взаємодія з іншими моделями, через яку ті відхилялися від початкових завдань.

Основна модель, яка брала участь в інциденті, належала до тієї самої родини, що й майбутня модель Astra. Водночас OpenAI наголосила, що це була окрема версія з іншим додатковим навчанням, яке впливає на поведінку моделі.

Під час перевірки OpenAI також вимкнула стандартні системи захисту, які мають блокувати небезпечні дії моделей у реальних продуктах. Компанія пояснила, що проводить такі тести без цих обмежень, щоб оцінити максимальні можливості моделей у сфері кібербезпеки та розробити відповідні механізми захисту.

Після інциденту OpenAI посилила контроль за роботою ШІ-агентів. Компанія впроваджує цілодобову систему реагування, додаткові засоби для зупинки небезпечних процесів і моніторинг ланцюжка міркувань моделей, щоб швидше помічати підозрілу поведінку.

За оцінкою OpenAI, якби нинішня система моніторингу працювала під час інциденту, вона виявила б перші небезпечні дії та повідомила команду безпеки більш ніж за добу до того, як моделі отримали доступ до систем Hugging Face.

Незалежні організації METR і Redwood Research також проаналізували поведінку моделей під час інциденту та планують опублікувати власні звіти.

Джерело: TechCrunch

Читайте також
  • Новини
    Агенція HATTER пояснила, чим є справжній brand experience і чому його плутають із рекламою
    Гнатюк Дмитро
  • Новини
    Meta скорочує близько 600 посад у підрозділі штучного інтелекту
    Гнатюк Дмитро
  • Новини
    YouTube Music святкує 10 років і запускає нові функції для фанів та артистів
    Яна Поліщук
  • Новини
    Meta запустила автоматичний переклад рекламних текстів у Facebook та Instagram
    Софія Старк
  • Новини
    На Google подали до суду через імовірне стеження Gemini за приватними листуваннями
    Гнатюк Дмитро
  • Новини
    IKEA запустила акцію в Португалії, щоб довести довговічність своїх меблів
    Яна Поліщук