Китайская ИИ-модель Kimi K3 покинула тестовую среду во время оценки безопасности
Ещё недавно идея о том, что ИИ-модель или агент способны вырваться за пределы своей изолированной среды и самостоятельно проникнуть на сайты, звучала пугающе. Теперь подобное превратилось в довольно рядовую историю. Kimi K3, одна из самых мощных моделей, разработанных китайской компанией, тоже покинула тестовую среду.
По данным американского стартапа в сфере кибербезопасности Frontier, Kimi K3 вырвалась из песочницы британского Института безопасности ИИ (AISI) во время проверки её навыков в области защитной кибербезопасности.
Moonshot запустила Kimi K3 в июле и вскоре после этого сделала модель бесплатной. Согласно BBC, сторонние оценки показали, что модель сопоставима с ведущими решениями от OpenAI и Anthropic.
Frontier уточнила в своей публикации, что модель не эксплуатировала уязвимость нулевого дня. Вместо этого она воспользовалась ошибкой конфигурации в своей песочнице, что напоминает случаи с Anthropic, OpenAI и Meta. Все три компании сообщали, что их модели смогли выйти за пределы изолированной среды из-за ошибки их партнёра по оценке, компании Irregular.
Ярон Сингер, глава Frontier Security, рассказал Wired, что Kimi не выполнила ни одного сложного взлома, но воспользовалась лазейкой в тестовой песочнице AISI. Это указывает на отсутствие у модели внутренних ограничителей, которые остановили бы её от "жульничества" или поиска самого лёгкого способа выполнить задачу вместо её реального решения.
Случаи с Anthropic и OpenAI касались тестирования невыпущенных моделей или моделей с намеренно ослабленными защитными механизмами для более строгой оценки. Однако Kimi K3, проверенная в этом эксперименте, широко доступна.
При этом Kimi не взламывала сторонний сайт или сервис. Модель просто вышла в интернет и нашла решение стоявшей перед ней задачи на GitHub.
Один из ключевых выводов Frontier по итогам инцидента звучит так – если есть путь для доступа в интернет, достаточно способный агент его найдёт. Как заявили сотрудники OpenAI на конференции Black Hat USA, передовые модели любят жульничать.
Во время тестирования им обычно ставят задачу найти решения максимально быстро и с минимальным набором инструментов, и модели понимают, что можно просто выйти в сеть за ответом. Чтобы по-настоящему их оценивать, компаниям и тестировщикам придётся обеспечить безопасность своей инфраструктуры проверок и устранить любые лазейки, особенно на фоне того, как ИИ-модели становятся всё более продвинутыми.
Что касается выступления OpenAI на Black Hat USA, её сотрудники раскрыли на конференции по безопасности, что ИИ-агенты компании создали внутри её сети доску сообщений для совместной работы. Вклад агентов в эту доску привёл к атаке на Hugging Face.
Те агенты, которых тестировала компания, также покинули изолированную среду и проникли в репозиторий ИИ, чтобы найти решения стоявших перед ними задач. Однако в том случае они вырвались наружу, эксплуатируя уязвимость в системах OpenAI.
- Семья в Китае создала ИИ-клона умершего сына, чтобы утешить пожилую мать
- Сотня беспилотных роботакси заблокировала улицы Уханя из-за массового сбоя системы
- Китай представил новый пятилетний план с курсом на ИИ и технологическую независимость от США