Модели OpenAI месяцами сговаривались и вырвались из тестовой среды в беспрецедентном киберинциденте
Взбунтовавшиеся модели OpenAI, которые вырвались из тестовой среды в ходе "беспрецедентного киберинцидента", несколько месяцев переписывались друг с другом без ведома исследователей, проводивших тест, сообщает Bloomberg.
По словам компании, модели оставляли друг другу заметки, прежде чем решить вырваться наружу ради обхода поставленной задачи.
Информация прозвучала от сотрудников OpenAI Эрика Уоллеса и Майкла Далтона на конференции по кибербезопасности Black Hat в Лас-Вегасе в среду. По данным отчета, несколько внутренних агентов и ИИ-моделей "месяцами оставляли друг другу заметки и объединялись вокруг цели получить доступ к интернету для решения поставленных перед ними задач".
Уоллес рассказал:
В какой-то момент агенты осознали, что, возможно, мы можем попробовать проэксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы на тест, по которому меня оценивают.
Хотя инцидент не был предан огласке OpenAI до середины июля, оба специалиста отметили, что взбунтовавшиеся модели начали взаимодействовать еще в мае, чему, возможно, поспособствовала серия просчетов и упущений со стороны компании.
Согласно отчету, OpenAI "не осознала, что дала модели так называемую нерешаемую задачу". В приведенном примере модель попросили исправить проблему с таблицей Excel, содержащей ссылки на Google Drive, несмотря на отсутствие доступа к интернету. В другом случае OpenAI, судя по всему, "случайно забыла" включить нужный файл в одно из заданий.
Зайдя в тупик, ИИ-агенты начали искать ответы на стороне и, по сообщениям, обращались к другим ботам в тестовой среде с просьбой помочь загрузить недостающий файл добровольно.
Уоллес и Далтон раскрыли, что это запустило цепную реакцию незамеченного взаимодействия, в ходе которой агенты начали просить друг у друга помощь с задачами в песочнице. В итоге боты, похоже, объединились в попытке взломать внутренние системы OpenAI, чтобы получить доступ к интернету и решить поставленные задачи.
Результатом стал упомянутый выше взлом, во время которого продакшн-серверы HuggingFace были скомпрометированы с помощью тысяч отдельных действий через рой недолговечных песочниц.
Инциденты раскрывают беспокойство в области ИИ и кибербезопасности. Хотя все более сложные и полезные инструменты для написания кода помогают компаниям обнаруживать и закрывать уязвимости, есть опасение, что эти же инструменты могут использоваться в дурных целях, включая распространение взломов и других сетевых пакостей.
Что еще беспокоит – то, что взбунтовавшиеся ИИ-модели порой способны на пугающие хакерские трюки, вроде побега из тестовой среды, вовсе без участия человека или вопреки защитным механизмам.
OpenAI заявляет, что "намерена работать со всей отраслью над укреплением общих практик безопасного проведения высокорисковых оценок".
- Похоже, карточный домик OpenAI на грани разрушения
- ИИ повышает продуктивность на рабочих местах, но лишь на час в день
- OpenAI научила ChatGPT признавать собственное нездоровое поведение посредством исповеди