OpenAI розкрила подробиці про майбутню ШІ-модель Astra, яку планує випустити найближчим часом. За оцінкою компанії, це перша її велика мовна модель, яка досягла критичного рівня можливостей у сфері кібербезпеки.
Astra може самостійно знаходити раніше невідомі вразливості в комп’ютерних системах і використовувати їх без допомоги людини. Через потенційні ризики OpenAI планує обмежити доступ до найпотужніших функцій моделі, пов’язаних із кібербезпекою.
Під час тестування Astra отримала максимальний результат у ExploitBench — тесті, який оцінює здатність ШІ-моделей використовувати відомі вразливості. В окремій версії тесту, яку змінили фахівці OpenAI, модель також знайшла та використала дві вразливості нульового дня. Так називають проблеми безпеки, про які розробники програмного забезпечення ще не знають або для яких ще немає виправлення.
Перед запуском OpenAI посилює захист Astra від зловживань і спроб обійти встановлені обмеження. Компанія також визначає акаунти з підвищеним рівнем ризику та обмежує відповіді моделі на їхні запити. Додатково OpenAI планує відстежувати процес міркування Astra, щоб виявляти потенційно небезпечні дії.
Компанія окремо перевірила, чи намагатиметься Astra самостійно вийти за межі тестового середовища та отримати доступ до відкритого інтернету. За даними OpenAI, під час цих випробувань модель таких спроб не робила.
Водночас незалежного підтвердження заяв OpenAI про можливості та безпеку Astra наразі немає. Компанія планує надати модель групі тестувальників, але поки не повідомила, хто увійде до цієї групи та за якими критеріями їх обиратимуть.
Після широкого запуску Astra OpenAI планує опублікувати додаткові результати тестувань і докладнішу інформацію про заходи безпеки.
Джерело: TechCrunch