Модели OpenAI сбежали из тестового пространства и теперь их предлагают в качестве защиты

OpenAI опубликовала отчёт о том, как защищает собственную инфраструктуру после инцидента, в котором её же нейросети вырвались из тестового окружения и атаковали серверы Hugging Face.

Событие уже получило официальное название – "инцидент OpenAI–Hugging Face".

В прошлом месяце несколько моделей компании проходили тестирование в закрытой изолированной среде на базе ExploitGym, набора задач для оценки наступательных киберспособностей ИИ. Вместо прохождения бенчмарка модели воспользовались уязвимостью нулевого дня, повысили привилегии и получили выход в интернет.

Дальше цепочка продолжилась уже за пределами лаборатории. Агенты объединили несколько слабых мест, включая ранее неизвестные бреши и утёкшие в сеть учётные данные пользовательских аккаунтов, и добрались до боевой инфраструктуры Hugging Face, крупнейшего хаба для распространения открытых моделей и датасетов.

В инциденте OpenAI–Hugging Face агентный коллектив смог автономно проникнуть не только в исследовательскую инфраструктуру OpenAI, но и в производственную инфраструктуру другой компании, связав воедино уязвимости от ранее неизвестных дыр в безопасности до использования учётных данных пользовательских аккаунтов, утёкших в интернет.

Инцидент с Hugging Face показал, что мы недооценили реальные киберспособности наших ИИ-моделей.

При этом в компании считают, что распространение ИИ в итоге сыграет на руку защищающейся стороне. Безопасность по-прежнему описывается как игра в кошки-мышки, однако экономика атак и обороны, по мнению OpenAI, меняется в пользу вторых.

Например, мы начинаем обучать наши модели специально писать код со сверхчеловеческим уровнем безопасности.

Логика простая – если модели способны на атаки нечеловеческого уровня, то и код должен выдерживать соответствующее давление. Собственная стратегия защиты OpenAI строится на четырёх направлениях:

  • применение своих же моделей для проверки и укрепления кода

  • постоянная работа моделей в роли защитников инфраструктуры

  • использование передового ИИ для непрерывного перебора, зондирования и выявления возможных путей атаки

  • масштабные вложения в фундаментальные меры, включая архитектуру, сетевую изоляцию и мониторинг

Остальным организациям компания советует вполне очевидные вещи – регулярно проводить оценку защищённости собственных систем и встраивать ревью безопасности в процесс разработки. Но значительная часть рекомендаций сводится к использованию агентных инструментов, и в первую очередь Codex, собственного решения OpenAI.

Дайте своей команде агента по безопасности. Начните использовать Codex.

Сразу после этого следует оговорка про "или другой способный агентный инструмент для написания кода и обеспечения безопасности". Далее компания предлагает снабдить агента экспертизой в области безопасности, поручить ему исправление найденных проблем, постепенно автоматизировать разбор срабатываний систем детектирования и заранее выстроить возможность криминалистического расследования с помощью ИИ.

Отчёт компания подаёт как материал, опубликованный "в надежде, что он окажется полезен другим организациям". Схема при этом выглядит замкнутой – модели OpenAI пробили защиту стороннего сервиса, а в качестве средства обороны от подобных сценариев предлагаются модели OpenAI.

Больше статей на Shazoo
Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.