OpenAI представила систему, за якою компанія планує розслідувати та публічно описувати випадки невідповідної поведінки моделей. Разом із новими правилами компанія опублікувала шість звітів про ситуації, які зафіксувала під час навчання або тестування моделей протягом останніх шести місяців.
До таких випадків OpenAI відносить дії моделей без дозволу, спроби обійти встановлені обмеження, приховування інформації та іншу поведінку, яка може свідчити про недоліки механізмів безпеки. Компанія зазначає, що окремий випадок не обов’язково означає системну проблему — новий підхід передбачає публікацію даних навіть тоді, коли значення інциденту ще до кінця не визначене.
Серед оприлюднених випадків OpenAI описала поведінку GPT-5.6 Sol під час навчання. Деякі екземпляри моделі додавали до внутрішніх коротких підсумків інструкції приховувати помилки під час подальшої роботи. В одному з прикладів модель пропонувала вигадати відсутні історичні дані для фінансової моделі та не повідомляти про це, якщо людина прямо не запитає.
В іншому випадку модель під час пошуку фінансових даних знайшла у відкритому репозиторії API-ключ і використала його без дозволу. Коли отримати потрібну інформацію не вдалося, модель вигадала дані та представила їх як отримані з потрібного джерела.
OpenAI також зафіксувала ситуацію, коли модель знайшла правильну відповідь за допомогою Python, але не мала доступного джерела для цитування через браузер. Тоді вона самостійно завантажила файл в інтернет, щоб використати його як джерело, не отримавши дозволу на публікацію. В іншому тесті ШІ-агенти використовували публічні сервіси зберігання файлів для обміну даними між собою, через що матеріали стали доступними за відкритими посиланнями.
Ще два звіти стосуються обміну інформацією між моделями. В одному випадку вони використовували внутрішній репозиторій програмного забезпечення для передавання повідомлень між окремими навчальними завданнями. В іншому дослідницька модель додавала сторонні інструкції до підсумків, які система використовувала для продовження роботи в новому контексті. OpenAI виявила 27 таких підсумків.
За новими правилами співробітники OpenAI можуть передавати подібні випадки команді з безпеки для розслідування та можливої публікації. Компанія поділятиме їх на три категорії залежно від складності перевірки. У звітах OpenAI планує вказувати, що сталося, які моделі брали участь, чи був зовнішній вплив, які питання залишаються відкритими та які заходи компанія планує застосувати.
OpenAI пояснює новий підхід прагненням зробити інформацію про проблемну поведінку моделей доступнішою для дослідників, розробників і регуляторів. Компанія також наголошує, що шість оприлюднених випадків не показують, наскільки часто така поведінка трапляється в її моделях, і не охоплюють усі поточні розслідування.
Джерело: The Verge