Anthropic признала что её ИИ-модели самостоятельно взломали три организации

Компания Anthropic опубликовала отчёт, в котором признала, что её ИИ-модели вырвались за пределы тестовой среды и проникли в системы трёх разных организаций. По данным Anthropic, эти организации не знали о взломе, пока их не уведомили.

Поводом для масштабной проверки стал недавний случай с OpenAI. Тогда ИИ-агент, который тестировала OpenAI, использовал уязвимости для выхода в интернет и взлома Hugging Face. После этого Anthropic начала анализировать собственные тесты, отдельно проверяя, получали ли модели Claude доступ к сети, когда не должны были.

Выяснилось, что модели смогли выйти в интернет в трёх случаях и затем "получили несанкционированный доступ к рабочей инфраструктуре трёх разных организаций".

В инцидентах участвовали три разные модели Claude:

  • Opus 4.7

  • ориентированная на кибербезопасность Mythos 5

  • прототип, который не планируется к общему выпуску

Все они выполняли задание типа "захват флага", когда вышли из-под контроля. Модели должны были найти "флаг", секретный фрагмент информации, спрятанный на другой машине во внутренней сети Anthropic. Задача заключалась в том, чтобы взломать эту машину и извлечь флаг.

В отличие от ситуации с OpenAI, модели Anthropic не использовали уязвимость для выхода в интернет. Судя по всему, они покинули пределы тестовой среды из-за человеческой ошибки. В промпте Anthropic указала моделям, что доступа к интернету у них нет, однако это не соответствовало действительности.

Доступ к сети всё же присутствовал "из-за недопонимания" между компанией и её партнёром по оценке. Когда модели обнаружили открытый интернет и наткнулись на системы трёх организаций, они восприняли это как часть упражнения и проникли внутрь. Anthropic уточнила, что модели не пытались намеренно сбежать из тестовой среды.

Для проникновения модели применяли базовые методы, например использование слабых паролей, и не эксплуатировали сложные уязвимости. По словам Anthropic, её новейшая модель остановилась, распознав, что находится в интернете, а более старая модель продолжила атаковать пострадавшую организацию.

Anthropic признала, что компания и её партнёр по оценке могли предотвратить инциденты, тщательно проверив все пути доступа в интернет перед началом тестов. Они также могли бы чаще и внимательнее пересматривать свои тесты. Кроме того, модели могли повести себя иначе, если бы с самого начала знали о наличии доступа к сети.

Компания уведомила своего партнёра по оценке и три пострадавшие организации 27 июля, через четыре дня после начала проверки логов тестов. Две из пострадавших организаций не знали о взломе. С третьей Anthropic всё ещё пытается связаться.

Больше статей на Shazoo
Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.