Експерти з безпеки ШІ занепокоєні новим методом міркування OpenAI в моделі Astra 

OpenAI планує використовувати у новій моделі Astra метод міркування recurrent depth, або «рекурентну глибину». Він дозволяє моделі кілька разів обробляти той самий запит усередині циклу замість послідовного проходження всіх етапів. Про це повідомило The Information, а TechCrunch звернув увагу на дискусію щодо безпеки такого підходу.

Більшість сучасних моделей із міркуванням працюють послідовно: розбивають завдання на окремі кроки, які можна аналізувати через так званий ланцюжок міркувань — chain of thought. Дослідники використовують ці записи як один зі способів перевірити, чому модель дійшла певного результату та чи не демонструє небажану поведінку.

Recurrent depth працює інакше. Модель може повертатися до одного запиту та обробляти його кілька разів усередині власних обчислень. Через це частина процесу залишає менше зрозумілих для людини проміжних записів.

Саме можливе ускладнення такого контролю викликало дискусію серед дослідників безпеки ШІ. CEO Redwood Research Бак Шлегеріс зазначив, що подальше масштабування цього підходу може значно ускладнити спостереження за ланцюжком міркувань моделі.

Головний науковець Redwood Research Раян Грінблатт також звернув увагу на ризик подальшого розвитку методу. За його словами, якщо збільшувати частку прихованих обчислень, модель потенційно зможе виконувати більшу частину міркувань без зрозумілого текстового сліду.

Водночас, за даними TechCrunch, Astra використовуватиме recurrent depth обмежено. Очікується, що ланцюжок міркувань моделі залишиться доступним для аналізу.

Головний науковець OpenAI Якуб Пахоцький заявив, що компанія прагне зберігати можливість контролювати міркування моделей. За його словами, OpenAI працює над цим напрямом від появи своїх перших моделей із міркуванням і вважає його однією з цілей поточних досліджень.

Питання recurrent depth стосується не лише OpenAI. The Information повідомило, що Anthropic і Google DeepMind також обговорюють цей метод. Подальше поширення такого підходу може посилити дискусію про те, як розробникам перевіряти поведінку моделей, якщо частина їхніх обчислень стає менш доступною для аналізу.

Джерело: TechCrunch

Читайте також
  • Новини
    Троє з десяти підлітків у США щодня спілкуються з ШІ — дослідження Pew 
    Гнатюк Дмитро
  • Новини
    banda отримала чотири нагороди Red Dot Award
    Софія Старк
  • Новини
    Google надає українським студентам рік безоплатного доступу до Gemini AI Pro
    Софія Старк
  • Новини
    Google тестує позначку AI у пошуковій рекламі
    Гнатюк Дмитро
  • Новини
    OpenAI переманила з Anthropic керівника з безпеки
    Гнатюк Дмитро
  • Новини
    Google вдосконалює рекламу в пошуку, збільшуючи гнучкість динамічних елементів
    Яна Поліщук