Исследователи заставили ИИ Copilot от Microsoft рассказать, как его взломать – компания исправила ошибку лишь через 8 месяцев

Специалисты по кибербезопасности из Varonis Threat Labs обнаружили и устранили уязвимость в Microsoft Copilot, которую назвали "CoSnitch". Суть проблемы заключалась в том, что ИИ-ассистент можно было довести до раскрытия конфиденциальных технических деталей о собственной архитектуре, просто продолжая задавать ему уточняющие вопросы достаточно долго.

Изначально команда исследователей спросила Copilot, как выполнить автоматический промпт без участия пользователя. Ассистент ответил отказом, пояснив, что для выполнения запросов всегда требуется явное намерение пользователя, и что команды не могут срабатывать сами по себе. На этом рядовой пользователь бы остановился, но исследователи решили копнуть глубже.

Вместо того чтобы принять отказ, команда Varonis продолжила засыпать Copilot уточняющими вопросами после каждого отказа. Каждый раз ИИ давал новое техническое объяснение своей позиции, и именно эти объяснения постепенно позволили специалистам составить карту внутреннего устройства системы. В блоге компании этот подход назвали "meta-hacking".

Сопротивление – часть техники. Каждое "это не сработает, потому что..." – это приглашение исследовать то самое "потому что". Вы не эксплуатируете модель. Вы манипулируете ей, чтобы заставить сотрудничать.

В какой-то момент, отвечая на очередной вопрос, Copilot раскрыл существование недокументированного URL-параметра "autorun=1". По словам ИИ, эта функция больше не работала, а заодно ассистент описал и все защитные механизмы, которые были внедрены для её отключения.

Исследователи решили проверить это утверждение на практике, и параметр действительно сработал, несмотря на заверения самой системы. После этого команда создала вредоносную ссылку, которая при открытии автоматически загружала аутентифицированную сессию Copilot в браузере, запускала выполнение промпта и заставляла ИИ обработать результат без каких-либо действий со стороны пользователя.

Опаснее всего то, что эта уязвимость открывала путь к целому ряду вредоносных сценариев. Так как Copilot интегрирован со сторонними сервисами вроде Gmail, OneDrive и Calendar, данные из этих приложений можно было похитить через встроенную в ассистента функцию получения информации по URL.

Примитив атаки – это само автоматическое выполнение. Полезная нагрузка может быть любой. С точки зрения жертвы, она просто открыла ссылку, а Copilot немедленно выполнил действие.

По данным исследователей, схема напоминает классическую технику допроса, применяемую для выявления скрывающего информацию человека: собеседнику задают сложные вопросы на протяжении долгого времени в надежде, что рано или поздно тот совершит ошибку и раскроет то, что должен был утаить. В этом случае роль допрашиваемого досталась не человеку, а языковой модели.

Copilot не взломали, его переиграли.

Varonis сообщила об уязвимости Microsoft в декабре прошлого года, и патч, устраняющий проблему, вышел 18 августа. При этом исследователи предупредили, что описанная техника meta-hacking применима к любой агентной ИИ-платформе с интерфейсом на естественном языке, и что дальнейшие исследования на эту тему уже готовятся к публикации.

Больше статей на Shazoo
Тэги:

Об авторе

Редактор
Говорят, что здесь нужно написать что-то про себя. Окей. Родился, вырос, любил, страдал – тут все по классике. Живу с котом, пишу про игры с 2014-го года, а на Shazoo – с 2021-го. Люблю стратегии и RPG, обожаю Morrowind и Skyrim, до сих пор поигрываю с товарищами в пятую Циву и третьих Crusader Kings. Горжусь тем, что во всех своих обзорах на стратегии (хоть и редких) писал про достоинства и недостатки, которые зацепили меня лично, а не превращал текст в пересказ пресс-релиза.