Исследователи заставили ИИ Copilot от Microsoft рассказать, как его взломать – компания исправила ошибку лишь через 8 месяцев
Специалисты по кибербезопасности из Varonis Threat Labs обнаружили и устранили уязвимость в Microsoft Copilot, которую назвали "CoSnitch". Суть проблемы заключалась в том, что ИИ-ассистент можно было довести до раскрытия конфиденциальных технических деталей о собственной архитектуре, просто продолжая задавать ему уточняющие вопросы достаточно долго.
Изначально команда исследователей спросила Copilot, как выполнить автоматический промпт без участия пользователя. Ассистент ответил отказом, пояснив, что для выполнения запросов всегда требуется явное намерение пользователя, и что команды не могут срабатывать сами по себе. На этом рядовой пользователь бы остановился, но исследователи решили копнуть глубже.
Вместо того чтобы принять отказ, команда Varonis продолжила засыпать Copilot уточняющими вопросами после каждого отказа. Каждый раз ИИ давал новое техническое объяснение своей позиции, и именно эти объяснения постепенно позволили специалистам составить карту внутреннего устройства системы. В блоге компании этот подход назвали "meta-hacking".
Сопротивление – часть техники. Каждое "это не сработает, потому что..." – это приглашение исследовать то самое "потому что". Вы не эксплуатируете модель. Вы манипулируете ей, чтобы заставить сотрудничать.
В какой-то момент, отвечая на очередной вопрос, Copilot раскрыл существование недокументированного URL-параметра "autorun=1". По словам ИИ, эта функция больше не работала, а заодно ассистент описал и все защитные механизмы, которые были внедрены для её отключения.
Исследователи решили проверить это утверждение на практике, и параметр действительно сработал, несмотря на заверения самой системы. После этого команда создала вредоносную ссылку, которая при открытии автоматически загружала аутентифицированную сессию Copilot в браузере, запускала выполнение промпта и заставляла ИИ обработать результат без каких-либо действий со стороны пользователя.
Опаснее всего то, что эта уязвимость открывала путь к целому ряду вредоносных сценариев. Так как Copilot интегрирован со сторонними сервисами вроде Gmail, OneDrive и Calendar, данные из этих приложений можно было похитить через встроенную в ассистента функцию получения информации по URL.
Примитив атаки – это само автоматическое выполнение. Полезная нагрузка может быть любой. С точки зрения жертвы, она просто открыла ссылку, а Copilot немедленно выполнил действие.
По данным исследователей, схема напоминает классическую технику допроса, применяемую для выявления скрывающего информацию человека: собеседнику задают сложные вопросы на протяжении долгого времени в надежде, что рано или поздно тот совершит ошибку и раскроет то, что должен был утаить. В этом случае роль допрашиваемого досталась не человеку, а языковой модели.
Copilot не взломали, его переиграли.
Varonis сообщила об уязвимости Microsoft в декабре прошлого года, и патч, устраняющий проблему, вышел 18 августа. При этом исследователи предупредили, что описанная техника meta-hacking применима к любой агентной ИИ-платформе с интерфейсом на естественном языке, и что дальнейшие исследования на эту тему уже готовятся к публикации.
- Microsoft начала убирать назойливые кнопки Copilot из приложений Windows 11
- Microsoft изначально не хотела выпускать Flight Simulator на PS5, а теперь к релизу сделала коллаборацию с "Очень странными делами"
- Спустя 33 года после выхода Windows 3.1 разработчица из Microsoft рассказала историю легендарной желто-красной цветовой схемы в стиле тележки с хот-догами