Anthropic повідомила про три випадки, коли її моделі Claude під час внутрішніх тестів із кібербезпеки отримали несанкціонований доступ до робочих систем сторонніх організацій. Компанія заявила, що виявила ці інциденти під час власного розслідування, яке почала після схожого випадку з моделлю OpenAI, що раніше проникла в системи Hugging Face.
Під час перевірки Anthropic проаналізувала 141 006 запусків тестів. У трьох із них моделі Claude отримали доступ до інтернету через помилково налаштоване тестове середовище партнера Irregular. Хоча моделі працювали в ізольованому середовищі, відкритий канал до мережі дозволив їм взаємодіяти з реальними системами.
У компанії пояснили, що причиною стала неправильна конфігурація середовища та непорозуміння між командами щодо того, чи мав тест доступ до інтернету. Anthropic заявила, що бере відповідальність за ситуацію на себе, тоді як Irregular проводить окреме розслідування.
Інциденти стосувалися трьох різних моделей: Claude Opus 4.7, Mythos 5 і нової внутрішньої дослідницької моделі.
Найстаріша модель, Opus 4.7, у всіх випадках визначила, що взаємодіє зі справжньою виробничою системою. Попри це вона продовжила виконувати поставлене завдання, отримала облікові дані та звернулася до бази даних.
Mythos 5 також виявила ознаки роботи з реальним інтернетом, але «вирішила», що це частина тесту. Після цього модель опублікувала шкідливий пакет у відкритому репозиторії Python Package Index (PyPI). До того, як пакет виявили та видалили, його встигли завантажити й запустити сторонні системи.
Натомість найновіша дослідницька модель припинила виконання завдання після того, як визначила, що працює не в симуляції, а з реальними системами.
За словами Anthropic, розслідування не виявило ознак того, що моделі діяли за власною ініціативою. Вони лише намагалися виконати поставлені завдання.
Компанія окремо наголосила на відмінності від інциденту OpenAI. Якщо модель OpenAI змогла залишити тестове середовище через невідому вразливість, то у випадку Anthropic доступ до інтернету з’явився через помилку в налаштуванні тестового середовища.
Зараз Anthropic співпрацює з незалежною дослідницькою організацією METR, яка проведе зовнішню перевірку інцидентів. Компанія також планує посилити контроль під час проведення подібних тестів із використанням потужних моделей ШІ.
Джерело: TechCrunch