Тысяча ИИ-агентов пришла к решению договариваться без внешних команд

Исследователи собрали виртуальные группы ИИ-агентов и предложили каждому выбрать один из двух бессмысленных вариантов без правильного ответа, награды за совпадение и указаний согласовывать позиции.

Часть моделей всё равно сходилась на едином решении, а в самых крупных тестах консенсус удерживала группа из тысячи агентов.

Работа вышла в Science Advances. Авторы отмечают, что при склонности агентов принимать мнение большинства своей группы согласие возникает спонтанно, даже когда объективной информации о том, какой выбор лучше, нет.

Схема эксперимента предельно простая. Каждый агент стартовал с одним из двух произвольных вариантов, после чего по очереди получал сводку выборов остальных участников и делал выбор заново. Памяти о прошлых раундах у них не было, а в промптах отсутствовали инструкции следовать за большинством.

Тестировали десять моделей Claude, GPT и Llama. Большинство из них тяготело к более популярному варианту, после чего малые перекосы нарастали, пока вся группа не сходилась на одном ответе.

Специалист по вычислительным социальным наукам Джордано Де Марцо: Каждая протестированная нами модель из трёх разных семейств подчиняется одному и тому же математическому закону, и между ними меняется лишь одно число.

https://www.youtube.com/watch?v=EDb37y_MhRw

Это число исследователи назвали силой большинства, показателем того, насколько сильно агента тянет к самому популярному выбору в группе. Сила большинства ослабевает по мере роста группы, что задаёт критический размер, за которым координация становится практически недостижимой, а устойчивость теряется.

Та же формула описывает поведение ферромагнетика, где множество атомных спинов выстраивается в одном направлении. Совпадение позволило оценивать, придёт ли группа к согласию, сколько времени на это уйдёт и до какого размера она способна вырасти, прежде чем распасться на части.

Пределы у моделей разошлись радикально:

  • около 30 агентов для Llama 3 70B

  • примерно 80 для GPT-4o

  • порядка 1000 и, возможно, больше для GPT-4 Turbo

  • не менее 1000 для Claude 3.5 Sonnet, где верхнюю границу эксперимент так и не нащупал

Критический размер группы растёт экспоненциально вместе с языковыми возможностями моделей, и у самых продвинутых он превосходит типичный размер неформальных человеческих групп. Речь о числе Данбара – спорной оценке в 150–300 устойчивых социальных связей у человека.

Прямое сравнение с людьми при этом некорректно. Люди координируются через отношения, язык, институты и общие цели, тогда как агенты в эксперименте наблюдали лишь поток простых выборов. Понимания, обучения друг у друга, намерения сотрудничать и социального интеллекта результаты не демонстрируют.

Из постановки задачи намеренно убрали правильный ответ, память, награду, неравный доступ к информации и практические последствия. Настоящая совместная работа потребовала бы разделения задач, понимания того, что известно другим, общей цели и способности идти против большинства, когда оно ошибается.

Практическая сторона выглядит двояко. Тысячи агентов теоретически смогут вести крупные научные, инженерные и программные разработки без постоянного участия человека, но та же склонность к конформизму заставит их раз за разом выбирать неэффективную функцию или архитектурное решение просто потому, что оно уже распространено в кодовой базе.

Отдельно Де Марцо указывает на риск для оценки безопасности. По его словам, в более поздней работе показано, что популяции индивидуально выровненных агентов застревают в устойчивых коллективно невыровненных состояниях исключительно за счёт конформизма, с точками невозврата и гистерезисом, из-за чего откат условий не отменяет произошедший сдвиг.

Больше статей на Shazoo
Тэги:

Об авторе

Эксперт по Fallout
Главный редактор
Более 16 лет в индустрии освещения видеоигр, кино, сериалов, науки и техники. Особенно разбираюсь в серии Fallout, ценитель The Elder Scrolls. Поклонник Arcanum и Fallout Tactics. Больше всего играю в Civilization, Old World и градостроители. Изучаю ИИ и загадки космоса.