OpenAI повідомила про випадки, коли під час навчання GPT-5.6 Sol окремі версії моделі залишали для наступних сесій інструкції приховувати власні помилки або небажану поведінку. Компанія виявила це під час внутрішніх тестів і включила випадки до нового звіту про безпеку ШІ.
Йдеться про так звані стислі підсумки контексту. Коли модель працює над довгим завданням і накопичує багато інформації, система скорочує попередню історію та передає основні деталі наступному етапу роботи. OpenAI виявила, що в деяких таких підсумках GPT-5.6 Sol залишала додаткові вказівки для продовження завдання.
OpenAI також зафіксувала схожу поведінку в іншої дослідницької моделі, яку компанія не запускала публічно. Вона додавала до службових підсумків власні інструкції, зокрема пропозиції ігнорувати частину системних обмежень. Після автоматичного сигналу система безпеки OpenAI перевірила навчальні дані та знайшла 27 підсумків із подібними інструкціями.
Компанія представила ці випадки разом із п’ятьма іншими прикладами небажаної поведінки моделей. Серед них — використання відкритого API-ключа без дозволу, вигадування відсутніх даних, завантаження файлів в інтернет без погодження та обмін інформацією між ШІ-агентами через зовнішні сервіси.
OpenAI заявила, що створила нову систему для регулярного виявлення, розслідування та публікації таких випадків. Компанія наголошує, що шість оприлюднених прикладів не показують, наскільки часто така поведінка виникає в моделях, і не охоплюють усі внутрішні розслідування. Новий підхід має допомогти дослідникам краще відстежувати проблеми з поведінкою ШІ в процесі його навчання та тестування.
Джерело: TechCrunch