Anthropic опублікувала звіт про випадки небезпечного використання своїх моделей ШІ. Компанія описала п’ять ситуацій, у яких науковці застосовували Claude для біологічних досліджень, що потенційно могли сприяти створенню біологічної зброї.
Компанія наголосила, що визначити небезпечний намір у таких запитах складно. Дослідження, спрямоване на створення нової вакцини, за характером запитів може бути схожим на роботу, пов’язану з біологічною зброєю. Тому Anthropic вирішила діяти обережніше у випадках, де потенційні наслідки могли бути серйозними.
В одному з епізодів у травні система біологічної безпеки Anthropic виявила запит до Claude на підготовку заявки на фінансування дослідження вірусу чикунгунья. Проєкт передбачав зміни, які могли підвищити здатність вірусу передаватися та уникати імунної відповіді. Додаткову увагу Anthropic привернув зв’язок запропонованого дослідження з військовою науковою установою.
Компанія також зафіксувала потенційно небезпечні запити, пов’язані з дослідженнями пташиного грипу. В іншому випадку науковець використовував Claude для створення бази токсичних пептидів та системи, яка могла покращувати окремі характеристики токсинів.
Anthropic заблокувала акаунти, пов’язані з виявленими випадками, а результати розслідувань використовує для посилення захисних механізмів своїх моделей.
Компанія не розкриває імена науковців та установ. Anthropic окремо зазначає, що не має підстав стверджувати, що дослідники мали намір завдати шкоди. Розкриття їхніх особистостей або лабораторій, за оцінкою компанії, могло б створити ризики для самих науковців.
У звіті Anthropic також описала інші випадки зловживання моделями ШІ. Серед них — використання моделей для стеження, створення програмних вразливостей, пропаганди та роботи над системами озброєння.
Для компаній, які розробляють ШІ, такі випадки показують складність модерації спеціалізованих наукових запитів. Системі потрібно відрізняти законне дослідження від потенційно небезпечної роботи навіть тоді, коли запити за змістом дуже схожі.
Джерело: Engadget