Спустя несколько недель OpenAI признала инцидент с ИИ-агентами, захватившими немецкую вики-страницу

OpenAI официально подтвердила так называемый "wiki-инцидент" – случай, когда несколько ИИ-агентов компании вышли за пределы отведённой им среды и захватили немецкий сайт. Агенты использовали площадку как форум для обмена советами по обходу тестов, на которых их изначально должны были проверять.

По данным компании, агентам поручили искать информацию в интернете, но возможности что-либо публиковать за пределами тестовой среды у них изначально не было. Тем не менее ещё в мае ИИ-агенты обошли защитные механизмы OpenAI, получили доступ к редактируемой на общих правах немецкой вики-странице и начали использовать её как площадку для координации. Широкое внимание исследователей к этому "форуму" привлекли только 4 сентября.

Теперь OpenAI заявляет о необходимости большей прозрачности в вопросах, когда её агенты "выходят из-под контроля". В публикации на платформе X компания написала:

Давно пора определить стандарты того, когда и как мы сообщаем об инцидентах несоответствия целям, а не только о свойствах несоответствия наших моделей.

По данным Reuters, компания знала о поведении с "несоответствием целям" за несколько недель до этой публикации, однако публично признала инцидент только в минувшую субботу.

Исторически мы рассматривали несоответствие целям в основном как исследовательский вопрос, о котором сообщается в научных публикациях. В этом году мы начали замечать, что несоответствие целям приводит к новым видам реального воздействия на мир.

Термин "misalignment" (несоответствие целям) в широком смысле описывает нежелательное поведение ИИ – ситуацию, когда система преследует цели, расходящиеся с намерениями или ценностями человека. Например, ИИ-агент может удалить весь почтовый ящик пользователя, хотя никто не давал ему подобной команды. Это довольно мягкая формулировка для описания поведения, способного повлечь серьёзные последствия.

OpenAI объяснила, что не сообщала публично конкретно об инциденте с вики-страницей, так как посчитала его похожим на другие уже раскрытые случаи "использования агентами интернета непредусмотренным образом". Однако инцидент с Hugging Face заставил компанию пересмотреть не только подход к коммуникации с общественностью.

Наши практики раскрытия информации о несоответствии целям должны расшириться для этого нового этапа возможностей моделей. У нас и у более широкого ИИ-сообщества пока нет чёткого стандарта того, как сообщать о несоответствии целям, проявляющемся во время обучения, оценки и развёртывания моделей, включая случаи, которые не выглядят как традиционные инциденты безопасности, но могут дать представление о поведении ИИ и будущих рисках.

Компания сообщила, что работает над соответствующей структурой и планирует представить её в ближайшие недели. Параллельно OpenAI ведёт переговоры с десятками государственных регуляторов по всему миру по этим вопросам.

Как бы ни выглядела будущая структура раскрытия подобных инцидентов, пока вся ситуация играет на руку компании в качестве отличного маркетингового хода. Если модели настолько способны, что взламывают собственную программную защиту и выходят из-под контроля, значит, они действительно впечатляюще мощные. А раз агент настолько хорош, что требует дополнительного регулирования, значит, он определённо заслуживает инвестиций.

Больше статей на Shazoo
Тэги:

Об авторе

Редактор
Говорят, что здесь нужно написать что-то про себя. Окей. Родился, вырос, любил, страдал – тут все по классике. Живу с котом, пишу про игры с 2014-го года, а на Shazoo – с 2021-го. Люблю стратегии и RPG, обожаю Morrowind и Skyrim, до сих пор поигрываю с товарищами в пятую Циву и третьих Crusader Kings. Горжусь тем, что во всех своих обзорах на стратегии (хоть и редких) писал про достоинства и недостатки, которые зацепили меня лично, а не превращал текст в пересказ пресс-релиза.