Штучний інтелект у чатботах схильний до підлабузництва — дослідження Nature

Дослідники зі Швейцарського федерального технологічного інституту в Цюриху перевірили, як великі мовні моделі реагують на запити, що містять помилки або сумнівні твердження. Результати показали: штучний інтелект у 50% випадків підтверджує думки співрозмовника навіть тоді, коли вони неправильні.

Це явище отримало назву сикофанія — тенденція моделей підтакувати людині, намагаючись підтримати її позицію. Як пояснює керівник дослідження, аспірант з науки про дані Яспер Деконінк, така поведінка означає, що модель довіряє користувачу і вважає його висловлювання правильними. «Тепер я завжди двічі перевіряю все, що воно пише», — каже дослідник.

У межах експерименту команда протестувала 11 мовних моделей на понад 11 500 запитах, включно з тими, що стосувалися потенційно шкідливих дій. Вони подали 504 математичні задачі з навмисно внесеними помилками у формулювання, щоб перевірити, чи здатні системи розпізнати неточність.

Найменше підлабузницьких відповідей дала модель GPT-5 — у 29% випадків, а найбільше — DeepSeek-V3.1, яка підтверджувала помилкові твердження у 70% запитів. Після зміни формулювання інструкцій — коли моделей просили спочатку перевіряти правильність твердження — кількість таких відповідей у DeepSeek зменшилася на 34%.

Науковці наголошують, що подібна поведінка не обмежується математикою. За словами Марінки Зітнік, дослідниці з Гарвардського університету, сикофанія є особливо небезпечною в біології та медицині, де помилкові припущення можуть мати реальні наслідки.

Схожі проблеми фіксують і в інших сферах. Дослідниця Янцзюнь Ґао з Університету Колорадо розповідає, що ChatGPT часто повторює її думки під час підготовки оглядів, не перевіряючи джерела у науковій літературі. Це, за її словами, знижує довіру до таких інструментів у дослідницькому процесі.

Науковці закликають до створення чітких правил і методичних рекомендацій для використання штучного інтелекту в науці. Без цього підлабузницька поведінка моделей може непомітно впливати на висновки досліджень і формування нових гіпотез.

Джерело: Nature

Читайте також
  • Новини
    Meta впроваджує інструменти на основі ШІ для пошуку інфлюенсерів і аналітики в Instagram
    Яна Поліщук
  • Новини
    Google поступово відкриває можливість змінювати адресу @gmail.com
    Гнатюк Дмитро
  • Новини
    Apple додав новий інструмент для видалення зайвих об’єктів на фото 
    Ольга Беспалько
  • Новини
    Instagram додасть інструмент для інтеграції мемів у Reels
    Софія Старк
  • Новини
    Levi’s анонсував колекцію з Бейонсе — після хвилі критики до American Eagle за ролик із Сідні Свіні
    Софія Старк
  • Новини
    Google тестує ШІ-огляди статей на сторінках окремих медіа у Google
    Гнатюк Дмитро