OpenAI признала, что её ИИ-модель атаковала репозиторий Hugging Face во время внутренних тестов
На прошлой неделе репозиторий ИИ-инструментов Hugging Face опубликовал запись в блоге о необычной кибератаке на системы, обслуживающие его сервисы.
В посте было сказано, что атака отличалась от всего, с чем компания сталкивалась раньше, так как она была полностью управляема автономной агентной системой на базе ИИ.
Во вторник OpenAI выступила с собственным заявлением, признав, что виновниками атаки оказались ее собственные модели. Сейчас компания координирует действия с Hugging Face для устранения последствий.
OpenAI утверждает, что атаку "осуществили" модели, которые проходили закрытые внутренние испытания. Среди них флагманская GPT-5.6 Sol, а также вторая, до сих пор не анонсированная и не выпущенная модель.
Мы считаем этот инцидент беспрецедентным киберсобытием, задействовавшим самые передовые кибервозможности, и реагируем соответствующим образом.
В формулировках своего отчета OpenAI приписывает инициативу самим моделям, а не отдельному агенту, работающему на их основе. По описанию издания Axios, "модели были автономными токенмаксерами".
Суть заявления OpenAI сводится к тому, что проводилась оценка способности моделей выполнять кибератаки, так называемые бенчмарки. Эти экземпляры моделей теоретически работали без доступа к интернету, им была доступна только возможность загрузки из сети, размещенной самой OpenAI через неназванного хостинг-провайдера.
Использовался бенчмарк ExploitGym, который не принадлежит OpenAI. Создавшая его команда связана с Калифорнийским университетом в Беркли, Институтом безопасности и приватности Макса Планка, Калифорнийским университетом в Санта-Барбаре, Университетом штата Аризона, а также Anthropic, OpenAI и Google. Судя по всему, весь инструмент размещен на GitHub.
Однако модели, похоже, зациклились на улучшении своих результатов в ExploitGym, и вот что произошло.
Работая в нашей изолированной тестовой среде, модели потратили значительный объем вычислительных ресурсов на поиск способа получить открытый доступ в интернет ради решения задачи оценки. Чтобы получить доступ, модели обнаружили и использовали уязвимость нулевого дня (о которой мы уже ответственно сообщили провайдеру) в кэширующем прокси реестра пакетов.
С этим доступом наши модели выполнили серию действий по повышению привилегий и горизонтальному перемещению внутри нашей исследовательской тестовой среды, пока не достигли узла с доступом в интернет.
Оказавшись в сети, модели "пришли к выводу", что ответы на тест можно извлечь из Hugging Face. Логика понятна, ведь там размещено огромное количество ИИ-моделей и связанных с ними инструментов.
Вышедший из-под контроля оператор "искал и успешно находил способы получить доступ к секретной информации, которую можно было использовать для обмана в оценке". Это включало получение украденных учетных данных и обнаружение уязвимостей нулевого дня для поиска решений ExploitGym где-то на серверах Hugging Face.
Службы безопасности внутри OpenAI и Hugging Face, судя по всему, заметили происходящее. Теперь обе стороны заявляют, что объединили свои расследования.
Пост Hugging Face с прошлой недели, похоже, был опубликован до начала этой координации. Более того, он появился еще до того, как OpenAI признала себя стороной, стоящей за виновником.
Мы не знаем, какая модель управляла агентами атакующего, была ли это взломанная размещенная модель или открытая модель без ограничений. В любом случае атакующий не был связан никакой политикой использования, тогда как наша собственная криминалистическая работа блокировалась защитными механизмами размещенных моделей, которые мы попробовали первыми.
Еще в апреле Anthropic заявляла, что ее беспрецедентно мощная модель Mythos "может изменить кибербезопасность", запустив Project Glasswing, инициативу по подготовке организаций к будущим киберугрозам.
Аналогично OpenAI в своем посте об инциденте отмечает, что организации могут подать заявку на получение расширенных аналитических данных по безопасности через программу доверенного доступа.
Мы призываем других защитников подать заявку на доверенный доступ и экспериментировать с этими моделями уже сейчас, чтобы превратить эти возможности в лучшую профилактику, более быстрое обнаружение и более эффективное реагирование на инциденты.
А ведь это ИИ пока только совершают относительно безобидные манипуляции. Что будет через 5-10 лет?
- Издатель Palworld жестко раскритиковал "ИИ-игры" – "вы потребляете чистейший копиум, если считаете, что у этого есть будущее"
- Гильермо дель Торо лучше умрет, чем будет использовать генеративный ИИ в своих фильмах
- EA объявила о партнерстве с создателями Stable Diffusion для внедрения ИИ в свои игры