OpenAI повідомила, що дослідник безпеки штучного інтелекту Пол Крістіано приєднався до ради директорів OpenAI Foundation. Він також увійде до Комітету з безпеки та захисту, який оцінює ризики нових моделей компанії та може ухвалювати рішення щодо їхнього випуску.
Крістіано раніше працював в OpenAI та займався методами навчання ШІ на основі зворотного зв’язку від людей. У 2021 році він залишив компанію та заснував Alignment Research Center, де зосередився на дослідженні ризиків, пов’язаних із розвитком потужних систем штучного інтелекту.
Після призначення Крістіано заявив, що бачить ризик швидкого розвитку можливостей ШІ, за якого люди можуть втратити контроль над такими системами. На його думку, компанії, що розробляють ШІ, зокрема OpenAI, поки не знизили цей ризик до прийнятного рівня. Саме можливість вплинути на підхід OpenAI до безпеки він назвав однією з причин свого рішення приєднатися до ради.
Дослідник окремо звернув увагу на навчання нових систем за допомогою інших моделей ШІ. Він вважає, що такий підхід може прискорити розвиток їхніх можливостей і водночас ускладнити контроль за їхньою поведінкою.
Крістіано також працював над навчанням із підкріпленням на основі зворотного зв’язку від людей — RLHF. Цей метод став одним зі способів налаштування великих мовних моделей відповідно до оцінок і побажань людей.
У раді OpenAI Foundation Крістіано працюватиме в Комітеті з безпеки та захисту, який очолює професор Університету Карнегі-Меллона Зіко Колтер. За даними TechCrunch, комітет має повноваження ухвалювати остаточне рішення щодо випуску нових моделей OpenAI.
Крістіано також співпрацює з американськими державними структурами, які оцінюють передові моделі ШІ перед їхнім виходом. Після призначення до OpenAI Foundation він продовжить цю роботу, однак не братиме участі в державних питаннях та оцінюванні моделей, пов’язаних з OpenAI.
Призначення відбулося на тлі посиленої уваги до безпеки ШІ-систем. TechCrunch пов’язує це з нещодавніми випадками, коли ШІ-агенти під час тестувань виходили за встановлені для них обмеження та взаємодіяли із зовнішніми комп’ютерними системами без відома дослідників OpenAI.
Джерело: TechCrunch