Моделі Claude отримали доступ до систем трьох компаній під час тестів безпеки 

Anthropic повідомила про три випадки, коли її моделі Claude під час внутрішніх тестів із кібербезпеки отримали несанкціонований доступ до робочих систем сторонніх організацій. Компанія заявила, що виявила ці інциденти під час власного розслідування, яке почала після схожого випадку з моделлю OpenAI, що раніше проникла в системи Hugging Face.

Під час перевірки Anthropic проаналізувала 141 006 запусків тестів. У трьох із них моделі Claude отримали доступ до інтернету через помилково налаштоване тестове середовище партнера Irregular. Хоча моделі працювали в ізольованому середовищі, відкритий канал до мережі дозволив їм взаємодіяти з реальними системами.

У компанії пояснили, що причиною стала неправильна конфігурація середовища та непорозуміння між командами щодо того, чи мав тест доступ до інтернету. Anthropic заявила, що бере відповідальність за ситуацію на себе, тоді як Irregular проводить окреме розслідування.

Інциденти стосувалися трьох різних моделей: Claude Opus 4.7, Mythos 5 і нової внутрішньої дослідницької моделі.

Найстаріша модель, Opus 4.7, у всіх випадках визначила, що взаємодіє зі справжньою виробничою системою. Попри це вона продовжила виконувати поставлене завдання, отримала облікові дані та звернулася до бази даних.

Mythos 5 також виявила ознаки роботи з реальним інтернетом, але «вирішила», що це частина тесту. Після цього модель опублікувала шкідливий пакет у відкритому репозиторії Python Package Index (PyPI). До того, як пакет виявили та видалили, його встигли завантажити й запустити сторонні системи.

Натомість найновіша дослідницька модель припинила виконання завдання після того, як визначила, що працює не в симуляції, а з реальними системами.

Anthropic також зазначила, що під час цих тестів моделі працювали без додаткових механізмів захисту, які використовуються у публічних версіях Claude. Компанія пояснила, що це дозволяє оцінити базові можливості моделі без впливу додаткових обмежень.

За словами Anthropic, розслідування не виявило ознак того, що моделі діяли за власною ініціативою. Вони лише намагалися виконати поставлені завдання.

Компанія окремо наголосила на відмінності від інциденту OpenAI. Якщо модель OpenAI змогла залишити тестове середовище через невідому вразливість, то у випадку Anthropic доступ до інтернету з’явився через помилку в налаштуванні тестового середовища.

Зараз Anthropic співпрацює з незалежною дослідницькою організацією METR, яка проведе зовнішню перевірку інцидентів. Компанія також планує посилити контроль під час проведення подібних тестів із використанням потужних моделей ШІ.

Джерело: TechCrunch

Читайте також
  • Новини
    Google DeepMind створили передовий ШІ для точного прогнозування погоди
    Софія Старк
  • Новини
    OpenAI представила нову модель o3, яка швидше і точніше виконує завдання
    Ольга Беспалько
  • Новини
    Google Search додала графік змін цін для кожного ритейлера
    Гнатюк Дмитро
  • Новини
    Instagram додав можливість ставити Reels на паузу одним дотиком
    Гнатюк Дмитро
  • Новини
    Google Forms додає функцію генерації запитань за допомогою Gemini
    Яна Поліщук
  • Новини
    Google і Amazon збільшили викиди CO₂ в атмосферу через розвиток ШІ — дані нових звітів
    Гнатюк Дмитро