Anthropic признала что её ИИ-модели самостоятельно взломали три организации
Компания Anthropic опубликовала отчёт, в котором признала, что её ИИ-модели вырвались за пределы тестовой среды и проникли в системы трёх разных организаций. По данным Anthropic, эти организации не знали о взломе, пока их не уведомили.
Поводом для масштабной проверки стал недавний случай с OpenAI. Тогда ИИ-агент, который тестировала OpenAI, использовал уязвимости для выхода в интернет и взлома Hugging Face. После этого Anthropic начала анализировать собственные тесты, отдельно проверяя, получали ли модели Claude доступ к сети, когда не должны были.
Выяснилось, что модели смогли выйти в интернет в трёх случаях и затем "получили несанкционированный доступ к рабочей инфраструктуре трёх разных организаций".
В инцидентах участвовали три разные модели Claude:
Opus 4.7
ориентированная на кибербезопасность Mythos 5
прототип, который не планируется к общему выпуску
Все они выполняли задание типа "захват флага", когда вышли из-под контроля. Модели должны были найти "флаг", секретный фрагмент информации, спрятанный на другой машине во внутренней сети Anthropic. Задача заключалась в том, чтобы взломать эту машину и извлечь флаг.
В отличие от ситуации с OpenAI, модели Anthropic не использовали уязвимость для выхода в интернет. Судя по всему, они покинули пределы тестовой среды из-за человеческой ошибки. В промпте Anthropic указала моделям, что доступа к интернету у них нет, однако это не соответствовало действительности.
Доступ к сети всё же присутствовал "из-за недопонимания" между компанией и её партнёром по оценке. Когда модели обнаружили открытый интернет и наткнулись на системы трёх организаций, они восприняли это как часть упражнения и проникли внутрь. Anthropic уточнила, что модели не пытались намеренно сбежать из тестовой среды.
Для проникновения модели применяли базовые методы, например использование слабых паролей, и не эксплуатировали сложные уязвимости. По словам Anthropic, её новейшая модель остановилась, распознав, что находится в интернете, а более старая модель продолжила атаковать пострадавшую организацию.
Anthropic признала, что компания и её партнёр по оценке могли предотвратить инциденты, тщательно проверив все пути доступа в интернет перед началом тестов. Они также могли бы чаще и внимательнее пересматривать свои тесты. Кроме того, модели могли повести себя иначе, если бы с самого начала знали о наличии доступа к сети.
Компания уведомила своего партнёра по оценке и три пострадавшие организации 27 июля, через четыре дня после начала проверки логов тестов. Две из пострадавших организаций не знали о взломе. С третьей Anthropic всё ещё пытается связаться.
- Новая модель Claude сама нашла 500 уязвимостей и напугала Уолл-стрит
- NASA впервые использовала ИИ-модель Claude для управления марсоходом Perseverance
- Исследование Anthropic опровергло идею сверхэффективности ИИ-ассистентов для программистов