Моделі Claude отримали доступ до систем трьох компаній під час тестів безпеки 

Anthropic повідомила про три випадки, коли її моделі Claude під час внутрішніх тестів із кібербезпеки отримали несанкціонований доступ до робочих систем сторонніх організацій. Компанія заявила, що виявила ці інциденти під час власного розслідування, яке почала після схожого випадку з моделлю OpenAI, що раніше проникла в системи Hugging Face.

Під час перевірки Anthropic проаналізувала 141 006 запусків тестів. У трьох із них моделі Claude отримали доступ до інтернету через помилково налаштоване тестове середовище партнера Irregular. Хоча моделі працювали в ізольованому середовищі, відкритий канал до мережі дозволив їм взаємодіяти з реальними системами.

У компанії пояснили, що причиною стала неправильна конфігурація середовища та непорозуміння між командами щодо того, чи мав тест доступ до інтернету. Anthropic заявила, що бере відповідальність за ситуацію на себе, тоді як Irregular проводить окреме розслідування.

Інциденти стосувалися трьох різних моделей: Claude Opus 4.7, Mythos 5 і нової внутрішньої дослідницької моделі.

Найстаріша модель, Opus 4.7, у всіх випадках визначила, що взаємодіє зі справжньою виробничою системою. Попри це вона продовжила виконувати поставлене завдання, отримала облікові дані та звернулася до бази даних.

Mythos 5 також виявила ознаки роботи з реальним інтернетом, але «вирішила», що це частина тесту. Після цього модель опублікувала шкідливий пакет у відкритому репозиторії Python Package Index (PyPI). До того, як пакет виявили та видалили, його встигли завантажити й запустити сторонні системи.

Натомість найновіша дослідницька модель припинила виконання завдання після того, як визначила, що працює не в симуляції, а з реальними системами.

Anthropic також зазначила, що під час цих тестів моделі працювали без додаткових механізмів захисту, які використовуються у публічних версіях Claude. Компанія пояснила, що це дозволяє оцінити базові можливості моделі без впливу додаткових обмежень.

За словами Anthropic, розслідування не виявило ознак того, що моделі діяли за власною ініціативою. Вони лише намагалися виконати поставлені завдання.

Компанія окремо наголосила на відмінності від інциденту OpenAI. Якщо модель OpenAI змогла залишити тестове середовище через невідому вразливість, то у випадку Anthropic доступ до інтернету з’явився через помилку в налаштуванні тестового середовища.

Зараз Anthropic співпрацює з незалежною дослідницькою організацією METR, яка проведе зовнішню перевірку інцидентів. Компанія також планує посилити контроль під час проведення подібних тестів із використанням потужних моделей ШІ.

Джерело: TechCrunch

Читайте також
  • Новини
    Revolut стане титульним партнером команди Audi у «Формулі-1» з сезону 2026 року
    Софія Старк
  • Новини
    Google показуватиме в пошуку вміст з email-розсилок компаній
    Софія Старк
  • Новини
    Meta вимкнула функцію, яка дозволяла створювати ШІ-зображення з будь-якого публічного Instagram-акаунта
    Гнатюк Дмитро
  • Новини
    Витрати на відеорекламу у Великій Британії зросли на 20% — звіт IAB UK за 2024 рік
    Софія Старк
  • Новини
    Google Ads запустила A/B-тестування зображень і відео в кампаніях Demand Gen
    Софія Старк
  • Новини
    Дослідження виявило понад 200 небезпечних застосунків для дітей в App Store
    Ольга Беспалько