Тысяча ИИ-агентов пришла к решению договариваться без внешних команд
Исследователи собрали виртуальные группы ИИ-агентов и предложили каждому выбрать один из двух бессмысленных вариантов без правильного ответа, награды за совпадение и указаний согласовывать позиции.
Часть моделей всё равно сходилась на едином решении, а в самых крупных тестах консенсус удерживала группа из тысячи агентов.
Работа вышла в Science Advances. Авторы отмечают, что при склонности агентов принимать мнение большинства своей группы согласие возникает спонтанно, даже когда объективной информации о том, какой выбор лучше, нет.
Схема эксперимента предельно простая. Каждый агент стартовал с одним из двух произвольных вариантов, после чего по очереди получал сводку выборов остальных участников и делал выбор заново. Памяти о прошлых раундах у них не было, а в промптах отсутствовали инструкции следовать за большинством.
Тестировали десять моделей Claude, GPT и Llama. Большинство из них тяготело к более популярному варианту, после чего малые перекосы нарастали, пока вся группа не сходилась на одном ответе.
Специалист по вычислительным социальным наукам Джордано Де Марцо: Каждая протестированная нами модель из трёх разных семейств подчиняется одному и тому же математическому закону, и между ними меняется лишь одно число.
Это число исследователи назвали силой большинства, показателем того, насколько сильно агента тянет к самому популярному выбору в группе. Сила большинства ослабевает по мере роста группы, что задаёт критический размер, за которым координация становится практически недостижимой, а устойчивость теряется.
Та же формула описывает поведение ферромагнетика, где множество атомных спинов выстраивается в одном направлении. Совпадение позволило оценивать, придёт ли группа к согласию, сколько времени на это уйдёт и до какого размера она способна вырасти, прежде чем распасться на части.
Пределы у моделей разошлись радикально:
около 30 агентов для Llama 3 70B
примерно 80 для GPT-4o
порядка 1000 и, возможно, больше для GPT-4 Turbo
не менее 1000 для Claude 3.5 Sonnet, где верхнюю границу эксперимент так и не нащупал
Критический размер группы растёт экспоненциально вместе с языковыми возможностями моделей, и у самых продвинутых он превосходит типичный размер неформальных человеческих групп. Речь о числе Данбара – спорной оценке в 150–300 устойчивых социальных связей у человека.
Прямое сравнение с людьми при этом некорректно. Люди координируются через отношения, язык, институты и общие цели, тогда как агенты в эксперименте наблюдали лишь поток простых выборов. Понимания, обучения друг у друга, намерения сотрудничать и социального интеллекта результаты не демонстрируют.
Из постановки задачи намеренно убрали правильный ответ, память, награду, неравный доступ к информации и практические последствия. Настоящая совместная работа потребовала бы разделения задач, понимания того, что известно другим, общей цели и способности идти против большинства, когда оно ошибается.
Практическая сторона выглядит двояко. Тысячи агентов теоретически смогут вести крупные научные, инженерные и программные разработки без постоянного участия человека, но та же склонность к конформизму заставит их раз за разом выбирать неэффективную функцию или архитектурное решение просто потому, что оно уже распространено в кодовой базе.
Отдельно Де Марцо указывает на риск для оценки безопасности. По его словам, в более поздней работе показано, что популяции индивидуально выровненных агентов застревают в устойчивых коллективно невыровненных состояниях исключительно за счёт конформизма, с точками невозврата и гистерезисом, из-за чего откат условий не отменяет произошедший сдвиг.
- Глава Google предупредил, что ИИ-пузырь не обойдет стороной никого
- Сначала крипта, теперь ИИ – Samsung повысит цены на оперативную память на 60%
- Бывший директор Square Enix считает, что большинство геймеров из поколения Z не волнует использование ИИ в играх