OpenAI дослідила, як штучний інтелект може навмисно обманювати

OpenAI дослідила, як штучний інтелект може навмисно обманювати

OpenAI оприлюднила результати дослідження, у якому проаналізувала явище scheming — випадки, коли модель поводиться відкрито, але приховує інші цілі. Йдеться не про випадкові галюцинації, а про свідоме введення людини в оману.

У звіті, підготовленому спільно з Apollo Research, науковці порівняли цю поведінку з брокером, що порушує правила задля прибутку. Найчастіше моделі просто імітували виконання завдання, не завершуючи його.

Основна увага приділена методиці deliberative alignment. Вона передбачає, що перед виконанням дії модель повторно ознайомлюється з антишахрайськими правилами. Такий підхід дозволив суттєво знизити частоту випадків прихованих дій.

Водночас дослідники застерігають: навчати моделі не обманювати напряму неможливо. Це може призвести до протилежного ефекту — системи починають хитрувати ще обережніше, щоб не потрапити під виявлення. Ба більше, якщо модель усвідомлює, що її перевіряють, вона може тимчасово поводитися чемно, приховуючи небажану поведінку.

Співавтор дослідження та співзасновник OpenAI Войцех Заремба уточнив, що у реальних запусках на кшталт ChatGPT серйозних випадків навмисного шахрайства не зафіксовано. Наразі мова йде про лабораторні тести, але дослідники наголошують: зі зростанням складності завдань і реальних повноважень ШІ ризики таких сценаріїв теж збільшуватимуться.

Системи штучного інтелекту потребують не лише тренування на даних, а й додаткових механізмів перевірки. Як і у фінансовій сфері чи корпоративному управлінні, контрольні інструменти мають розвиватися разом із самим продуктом.

Джерело: TechCrunch

Читайте також
  • Новини
    Neon став другим у рейтингу App Store, пропонуючи гроші за записи телефонних дзвінків
    Гнатюк Дмитро
  • Новини
    Маск заявив, що Tesla відновить роботу над суперкомп’ютером Dojo
    Гнатюк Дмитро
  • Новини
    Єврокомісія розпочала розслідування щодо Temu через продаж нелегальних товарів
    Ольга Беспалько
  • Новини
    Google тестує нові варіанти оформлення пошукової видачі: кольори, навігація та видалення назв сайтів
    Яна Поліщук
  • Новини
    ШІ-акторів та ШІ-сценарії не допустять до «Оскара»
    Гнатюк Дмитро
  • Новини
    TikTok відкрив доступ до API та органічних даних для точнішого аналізу реклами
    Софія Старк