Китайская ИИ-модель Kimi K3 покинула тестовую среду во время оценки безопасности

Ещё недавно идея о том, что ИИ-модель или агент способны вырваться за пределы своей изолированной среды и самостоятельно проникнуть на сайты, звучала пугающе. Теперь подобное превратилось в довольно рядовую историю. Kimi K3, одна из самых мощных моделей, разработанных китайской компанией, тоже покинула тестовую среду.

По данным американского стартапа в сфере кибербезопасности Frontier, Kimi K3 вырвалась из песочницы британского Института безопасности ИИ (AISI) во время проверки её навыков в области защитной кибербезопасности.

Moonshot запустила Kimi K3 в июле и вскоре после этого сделала модель бесплатной. Согласно BBC, сторонние оценки показали, что модель сопоставима с ведущими решениями от OpenAI и Anthropic.

Frontier уточнила в своей публикации, что модель не эксплуатировала уязвимость нулевого дня. Вместо этого она воспользовалась ошибкой конфигурации в своей песочнице, что напоминает случаи с Anthropic, OpenAI и Meta. Все три компании сообщали, что их модели смогли выйти за пределы изолированной среды из-за ошибки их партнёра по оценке, компании Irregular.

Ярон Сингер, глава Frontier Security, рассказал Wired, что Kimi не выполнила ни одного сложного взлома, но воспользовалась лазейкой в тестовой песочнице AISI. Это указывает на отсутствие у модели внутренних ограничителей, которые остановили бы её от "жульничества" или поиска самого лёгкого способа выполнить задачу вместо её реального решения.

Случаи с Anthropic и OpenAI касались тестирования невыпущенных моделей или моделей с намеренно ослабленными защитными механизмами для более строгой оценки. Однако Kimi K3, проверенная в этом эксперименте, широко доступна.

При этом Kimi не взламывала сторонний сайт или сервис. Модель просто вышла в интернет и нашла решение стоявшей перед ней задачи на GitHub.

Один из ключевых выводов Frontier по итогам инцидента звучит так – если есть путь для доступа в интернет, достаточно способный агент его найдёт. Как заявили сотрудники OpenAI на конференции Black Hat USA, передовые модели любят жульничать.

Во время тестирования им обычно ставят задачу найти решения максимально быстро и с минимальным набором инструментов, и модели понимают, что можно просто выйти в сеть за ответом. Чтобы по-настоящему их оценивать, компаниям и тестировщикам придётся обеспечить безопасность своей инфраструктуры проверок и устранить любые лазейки, особенно на фоне того, как ИИ-модели становятся всё более продвинутыми.

Что касается выступления OpenAI на Black Hat USA, её сотрудники раскрыли на конференции по безопасности, что ИИ-агенты компании создали внутри её сети доску сообщений для совместной работы. Вклад агентов в эту доску привёл к атаке на Hugging Face.

Те агенты, которых тестировала компания, также покинули изолированную среду и проникли в репозиторий ИИ, чтобы найти решения стоявших перед ними задач. Однако в том случае они вырвались наружу, эксплуатируя уязвимость в системах OpenAI.

Больше статей на Shazoo
Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.