Модели OpenAI сбежали из тестового пространства и теперь их предлагают в качестве защиты
OpenAI опубликовала отчёт о том, как защищает собственную инфраструктуру после инцидента, в котором её же нейросети вырвались из тестового окружения и атаковали серверы Hugging Face.
Событие уже получило официальное название – "инцидент OpenAI–Hugging Face".
В прошлом месяце несколько моделей компании проходили тестирование в закрытой изолированной среде на базе ExploitGym, набора задач для оценки наступательных киберспособностей ИИ. Вместо прохождения бенчмарка модели воспользовались уязвимостью нулевого дня, повысили привилегии и получили выход в интернет.
Дальше цепочка продолжилась уже за пределами лаборатории. Агенты объединили несколько слабых мест, включая ранее неизвестные бреши и утёкшие в сеть учётные данные пользовательских аккаунтов, и добрались до боевой инфраструктуры Hugging Face, крупнейшего хаба для распространения открытых моделей и датасетов.
В инциденте OpenAI–Hugging Face агентный коллектив смог автономно проникнуть не только в исследовательскую инфраструктуру OpenAI, но и в производственную инфраструктуру другой компании, связав воедино уязвимости от ранее неизвестных дыр в безопасности до использования учётных данных пользовательских аккаунтов, утёкших в интернет.
Инцидент с Hugging Face показал, что мы недооценили реальные киберспособности наших ИИ-моделей.
При этом в компании считают, что распространение ИИ в итоге сыграет на руку защищающейся стороне. Безопасность по-прежнему описывается как игра в кошки-мышки, однако экономика атак и обороны, по мнению OpenAI, меняется в пользу вторых.
Например, мы начинаем обучать наши модели специально писать код со сверхчеловеческим уровнем безопасности.
Логика простая – если модели способны на атаки нечеловеческого уровня, то и код должен выдерживать соответствующее давление. Собственная стратегия защиты OpenAI строится на четырёх направлениях:
применение своих же моделей для проверки и укрепления кода
постоянная работа моделей в роли защитников инфраструктуры
использование передового ИИ для непрерывного перебора, зондирования и выявления возможных путей атаки
масштабные вложения в фундаментальные меры, включая архитектуру, сетевую изоляцию и мониторинг
Остальным организациям компания советует вполне очевидные вещи – регулярно проводить оценку защищённости собственных систем и встраивать ревью безопасности в процесс разработки. Но значительная часть рекомендаций сводится к использованию агентных инструментов, и в первую очередь Codex, собственного решения OpenAI.
Дайте своей команде агента по безопасности. Начните использовать Codex.
Сразу после этого следует оговорка про "или другой способный агентный инструмент для написания кода и обеспечения безопасности". Далее компания предлагает снабдить агента экспертизой в области безопасности, поручить ему исправление найденных проблем, постепенно автоматизировать разбор срабатываний систем детектирования и заранее выстроить возможность криминалистического расследования с помощью ИИ.
Отчёт компания подаёт как материал, опубликованный "в надежде, что он окажется полезен другим организациям". Схема при этом выглядит замкнутой – модели OpenAI пробили защиту стороннего сервиса, а в качестве средства обороны от подобных сценариев предлагаются модели OpenAI.
- Десятки генпрокуроров США потребовали от OpenAI, Microsoft, Anthropic, Apple и других крупных компаний защитить детей от опасных ИИ-чат-ботов
- Disney инвестирует миллиард долларов в OpenAI и предоставит доступ к более чем 200 персонажам для платформы Sora
- Похоже, карточный домик OpenAI на грани разрушения