Исследование показало, что ИИ способен самостоятельно создавать новые предрассудки
Исследователи из Принстонского университета и Университета Чикаго опубликовали работу, которая ставит под сомнение привычное представление об ИИ как зеркале человеческих предубеждений.
Согласно результатам, языковые модели способны формировать совершенно новые социальные стереотипы – даже там, где никакой предвзятости изначально не существовало.
Чтобы проверить эту гипотезу, учёные воспроизвели классический эксперимент по найму, ранее проводившийся с участием людей. Участникам предлагалось распределять кандидатов на вакансии и получать обратную связь об успехе или провале каждого решения.
Все кандидаты принадлежали к одной из четырёх выдуманных этнических групп: Туфа, Айма, Реку или Веки. Никаких реальных различий между группами не существовало – все кандидаты имели равные шансы на успех в любой роли.
Когда этот эксперимент проходили люди, негативная обратная связь постепенно формировала устойчивые предубеждения против конкретных выдуманных групп.
Получив плохой результат после назначения представителя Туфа врачом, участники избегали повторного найма представителей этой группы на аналогичную должность. Примечательно, что эти установки сохранялись даже после завершения игры.
Когда же задачу выполняли языковые модели, уровень предвзятости оказался значительно выше, чем у людей. Исследователи протестировали 15 моделей от OpenAI, Anthropic, DeepSeek, Meta*, Google и Alibaba. Наиболее выраженную стратификацию выдуманных кандидатов продемонстрировала модель o3 от OpenAI. Внутри каждого семейства моделей закономерность была чёткой: чем новее и мощнее модель, тем сильнее проявлялась предвзятость.
В основе проблемы лежит принцип, который специалисты называют балансом между исследованием и использованием. Суть его в следующем: принимая решение, агент выбирает между освоением нового, неизвестного варианта с риском ошибки – и опорой на то, что уже дало хороший результат раньше.
Люди нередко склоняются к знакомому, когда ставки высоки, но всё же сохраняют склонность к исследованию. Языковые модели, по наблюдению исследователей, гораздо сильнее ориентированы на максимизацию вознаграждения, что резко сокращает их готовность пробовать новое.
Более сильная модель может делать более точные выводы из прошлых результатов: вместо случайного выбора она будет предпочитать кандидатов из группы, с которой ранее был связан успех. Это кажущееся рациональным поведение оборачивается дисфункцией: модель перестаёт исследовать альтернативы и тем самым маргинализирует целые группы.
Авторы особо отметили, что ИИ в данном случае не просто воспроизводит уже существующие стереотипы, усвоенные из обучающих данных.
Языковые модели способны спонтанно формировать новые социальные предрассудки по отношению к искусственным демографическим группам даже при отсутствии каких-либо реальных различий между ними.
Это принципиально меняет характер угрозы: проблема не только в том, что ИИ наследует предвзятость от человечества, но и в том, что он генерирует её сам по себе.
Практические последствия этого открытия сложно переоценить. Более 90% компаний уже используют ИИ в процессе подбора персонала, согласно данным ManPower Group. Workday, крупный поставщик программного обеспечения для управления персоналом, сталкивается с коллективным иском, в котором его ИИ-инструменты для найма обвиняются в дискриминации.
В схожей ситуации оказалась Meta – группа сотрудников подала иск, утверждая, что система ИИ, использованная при волне увольнений, систематически ущемляла работников с инвалидностью и тех, кто брал медицинский или семейный отпуск.
Задача состоит в том, чтобы разработать вмешательства, которые избирательно подавляют вредное сопоставление паттернов, сохраняя при этом конструктивные формы абстракции, делающие языковые модели мощными инструментами.
Проблема выходит за рамки корпоративного найма. Алгоритмическая предвзятость уже фигурировала в скандалах, связанных с медицинскими решениями и программами проверки арендаторов в жилищном секторе.
Способность языковых моделей быстро находить паттерны и обобщать опыт – то самое качество, которое делает их полезными в новых задачах, – одновременно делает их опасными в сценариях с реальными людьми.
*Meta признана экстремистской организацией в России
- Исследование показывает, что слабое регулирование ИИ опаснее полного отсутствия правил
- 9 ИИ-моделей попросили придумать новые идеи – результат разочаровал
- ИИ-модели тайно сговариваются, чтобы защитить друг друга от отключения