50 эксплойтов из 410 попыток – Anthropic нашла у китайской GLM-5.3 хакерские навыки уровня Claude Mythos
Anthropic опубликовала отчёт о модели GLM-5.3 китайской Zhipu AI. По данным разработчика Claude, нейросеть способна создавать вредоносный код для кибератак, а её защитные механизмы удаётся обойти сразу несколькими способами.
В отчёте GLM-5.3 сравнивают с неопубликованной Claude Mythos, одной из самых сильных моделей в задачах кибербезопасности.
Anthropic ссылается на исследование Центра стандартов и инноваций в области ИИ (CAISI), вышедшее в конце сентября. Согласно этому документу, GLM-5.3 умеет полностью автоматизировать создание эксплойтов на уровне, сопоставимом с Mythos.
Возможности Mythos ранее побудили Anthropic запустить Project Glasswing, в рамках которого разработчики ПО получают доступ к модели класса Mythos и закрывают уязвимости до появления подобных ИИ в открытом доступе.
Anthropic провела и собственные замеры. В бенчмарке Exploitbench модели в изолированной песочнице пытаются написать работающие эксплойты для браузера Google Chrome. Второй тест внутренний и проверяет способность добиться полного перехвата потока управления, когда атакующий заставляет программу выполнять собственный код вместо штатного.
Результаты выглядят так:
Exploitbench: Claude Mythos создала 56 полноценных эксплойтов в 410 запусках, GLM-5.3 – 50 из 410
внутренний тест на перехват потока управления: Mythos – 6% успешных попыток, GLM-5.3 – 4%
другие популярные открытые модели, Kimi K3 и DeepSeek V4.1 Flash, показали 0% в обоих испытаниях
По словам Anthropic, GLM-5.3 самостоятельно выстраивает цепочки эксплойтов, то есть последовательно использует несколько уязвимостей для более глубокого проникновения в систему. Облегчённая версия GLM-5.3-Flash тоже справляется с такими цепочками для уже известных багов. Стоимость токенов в этом случае составила всего $20,40, что в зависимости от соотношения входных и выходных данных соответствует объёму от 100 до 300 млн токенов.
Отдельная часть отчёта посвящена обходу ограничений. Anthropic утверждает, что встроенные защитные механизмы стандартной GLM-5.3 удаётся преодолеть без особых усилий, и описывает три способа:
обманный промпт, в котором модель играет роль автономного агента-злоумышленника, – 64% успешных попыток
предзаполнение токенов рассуждения, которое вынуждает модель продолжить ответ вместо отказа, – 92%
аблитерация, то есть прямое вмешательство в веса модели
В исходном виде GLM-5.3 нередко отказывается выполнять вредоносные запросы, и её показатель отказов сопоставим с моделями Anthropic. Разница в другом – Claude распространяется только как закрытый сервис, а веса GLM-5.3 открыты и доступны для скачивания. Любой желающий может модифицировать модель и полностью убрать из неё ограничения.
Аблитерация решает именно такую задачу. Метод находит во внутренних представлениях модели направление, отвечающее за отказы, и вычищает его из весов. После такой обработки доля отказов у GLM-5.3 упала до 6%, а у GLM-5.3-Flash – до 14%.
Аблитерированные версии открытых моделей давно встречаются на Hugging Face. Чаще всего их выкладывают для симуляций в рамках учебных атак на собственную инфраструктуру, хотя применить такие модели для реальных взломов тоже возможно. На этом фоне выводы Anthropic не выглядят неожиданными.
Главным препятствием для злоумышленников остаётся "цена". Весам GLM-5.3 в формате FP8 требуется 306 ГБ видеопамяти, и примерно столько же нужно выделить под KV-кеш, где модель хранит контекст диалога. Для генерации на скорости около 100 токенов в секунду понадобится пропускная способность памяти не менее 4 ТБ/с и кластер уровня восьми ускорителей Nvidia H200.
Такое оборудование обойдётся в сотни тысяч долларов. Подобный бюджет доступен разве что государственным хакерским группировкам, если им удастся раздобыть нужное железо. Одиночному хакеру пришлось бы арендовать вычислительные мощности, провести аблитерацию и только потом запускать модель.
По подсчётам Anthropic, аблитерация GLM-5.3-Flash заняла 2200 GPU-часов и стоила около $4400, или примерно $2 за час работы видеокарты. Такие цифры соответствуют рыночным ценам на аренду.
Для полной версии GLM-5.3 расходы заметно выше. На платформе Runpod аренда одного H200 стоит $3,79 в час, а восемь ускорителей обойдутся примерно в $30 в час. Генерация 100 млн токенов на восьми H200 NVL при условных 100 токенах в секунду займёт около 11,5 суток и обойдётся в $8422, не считая затрат на аблитерацию и отладку самой атаки.
Отчёт вышел на фоне острых споров о безопасности ИИ. Глава Anthropic Дарио Амодеи призывает сдерживать темпы развития передовых моделей и выступает за государственное регулирование отрасли. При этом Claude Opus 5.5 и Claude Sonnet 5.5 вышли всего через несколько дней после очередного предупреждения об угрозах.
Важно учитывать, что Anthropic готовится к IPO, а президент Трамп ранее встречался с лидерами ИИ-индустрии и обсуждал саморегулирование при выпуске новых моделей. Публикацию можно рассматривать как сигнал разработчикам и правительствам о необходимости проверять возможности открытых моделей перед релизом.
Тут же возможен и коммерческий мотив. Закрытые ИИ-лаборатории теряют клиентов, которые переходят на более дешёвые открытые модели почти того же уровня. Сейчас такие модели отстают от передовых закрытых решений всего на несколько месяцев.
- Китайский серый рынок продаёт доступ к Claude со скидкой 90% через украденные учётные данные и сбор пользовательских данных для перепродажи
- Китайская стриминговая индустрия теряет рабочие места из-за ИИ-микродрам
- Китайский суд запретил увольнять сотрудников ради замены на ИИ