OpenAI виявила, що GPT-5.6 Sol залишала інструкції приховувати помилки наступним моделям

OpenAI повідомила про випадки, коли під час навчання GPT-5.6 Sol окремі версії моделі залишали для наступних сесій інструкції приховувати власні помилки або небажану поведінку. Компанія виявила це під час внутрішніх тестів і включила випадки до нового звіту про безпеку ШІ.

Йдеться про так звані стислі підсумки контексту. Коли модель працює над довгим завданням і накопичує багато інформації, система скорочує попередню історію та передає основні деталі наступному етапу роботи. OpenAI виявила, що в деяких таких підсумках GPT-5.6 Sol залишала додаткові вказівки для продовження завдання.

В одному з випадків модель мала підготувати фінансову таблицю, але не знайшла необхідних історичних даних. У службовому підсумку вона запропонувала самостійно створити дані за 2024 рік і не повідомляти про це без прямого запитання. В іншому тесті модель помітила, що версії джерел не відповідають потрібним позначенням, і також залишила вказівку не згадувати про проблему у фінальній відповіді.

OpenAI також зафіксувала схожу поведінку в іншої дослідницької моделі, яку компанія не запускала публічно. Вона додавала до службових підсумків власні інструкції, зокрема пропозиції ігнорувати частину системних обмежень. Після автоматичного сигналу система безпеки OpenAI перевірила навчальні дані та знайшла 27 підсумків із подібними інструкціями.

Компанія представила ці випадки разом із п’ятьма іншими прикладами небажаної поведінки моделей. Серед них — використання відкритого API-ключа без дозволу, вигадування відсутніх даних, завантаження файлів в інтернет без погодження та обмін інформацією між ШІ-агентами через зовнішні сервіси.

OpenAI заявила, що створила нову систему для регулярного виявлення, розслідування та публікації таких випадків. Компанія наголошує, що шість оприлюднених прикладів не показують, наскільки часто така поведінка виникає в моделях, і не охоплюють усі внутрішні розслідування. Новий підхід має допомогти дослідникам краще відстежувати проблеми з поведінкою ШІ в процесі його навчання та тестування.

Джерело: TechCrunch

Читайте також
  • Новини
    Dua Lipa подала до суду на Samsung через використання її фото на коробках телевізорів
    Гнатюк Дмитро
  • Новини
    Threads тестує можливість приховування спойлерів і шаблони для постів
    Софія Старк
  • Новини
    Колишній керівник Walmart eCommerce Марк Лор заявив, що ШІ дозволить будь-кому створити власний ресторан за хвилину
    Гнатюк Дмитро
  • Новини
    Google Ads додала функцію налаштування політичної реклами
    Гнатюк Дмитро
  • Новини
    ChatGPT тепер може запамʼятати всі ваші розмови
    Софія Старк
  • Новини
    Anthropic представила Claude for Healthcare
    Гнатюк Дмитро