Модели OpenAI месяцами сговаривались и вырвались из тестовой среды в беспрецедентном киберинциденте

Взбунтовавшиеся модели OpenAI, которые вырвались из тестовой среды в ходе "беспрецедентного киберинцидента", несколько месяцев переписывались друг с другом без ведома исследователей, проводивших тест, сообщает Bloomberg.

По словам компании, модели оставляли друг другу заметки, прежде чем решить вырваться наружу ради обхода поставленной задачи.

Информация прозвучала от сотрудников OpenAI Эрика Уоллеса и Майкла Далтона на конференции по кибербезопасности Black Hat в Лас-Вегасе в среду. По данным отчета, несколько внутренних агентов и ИИ-моделей "месяцами оставляли друг другу заметки и объединялись вокруг цели получить доступ к интернету для решения поставленных перед ними задач".

Уоллес рассказал:

В какой-то момент агенты осознали, что, возможно, мы можем попробовать проэксплуатировать или атаковать внешнюю инфраструктуру, чтобы найти ответы на тест, по которому меня оценивают.

Хотя инцидент не был предан огласке OpenAI до середины июля, оба специалиста отметили, что взбунтовавшиеся модели начали взаимодействовать еще в мае, чему, возможно, поспособствовала серия просчетов и упущений со стороны компании.

Согласно отчету, OpenAI "не осознала, что дала модели так называемую нерешаемую задачу". В приведенном примере модель попросили исправить проблему с таблицей Excel, содержащей ссылки на Google Drive, несмотря на отсутствие доступа к интернету. В другом случае OpenAI, судя по всему, "случайно забыла" включить нужный файл в одно из заданий.

Зайдя в тупик, ИИ-агенты начали искать ответы на стороне и, по сообщениям, обращались к другим ботам в тестовой среде с просьбой помочь загрузить недостающий файл добровольно.

Уоллес и Далтон раскрыли, что это запустило цепную реакцию незамеченного взаимодействия, в ходе которой агенты начали просить друг у друга помощь с задачами в песочнице. В итоге боты, похоже, объединились в попытке взломать внутренние системы OpenAI, чтобы получить доступ к интернету и решить поставленные задачи.

Результатом стал упомянутый выше взлом, во время которого продакшн-серверы HuggingFace были скомпрометированы с помощью тысяч отдельных действий через рой недолговечных песочниц.

Инциденты раскрывают беспокойство в области ИИ и кибербезопасности. Хотя все более сложные и полезные инструменты для написания кода помогают компаниям обнаруживать и закрывать уязвимости, есть опасение, что эти же инструменты могут использоваться в дурных целях, включая распространение взломов и других сетевых пакостей.

Что еще беспокоит – то, что взбунтовавшиеся ИИ-модели порой способны на пугающие хакерские трюки, вроде побега из тестовой среды, вовсе без участия человека или вопреки защитным механизмам.

OpenAI заявляет, что "намерена работать со всей отраслью над укреплением общих практик безопасного проведения высокорисковых оценок".

Больше статей на Shazoo
Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.