9 ИИ-моделей попросили придумать новые идеи – результат разочаровал
Исследователи из Йельского университета и Чикагского университета поставили девять ИИ-моделей в одинаковые условия с живыми учёными и получили однообразный результат.
Каждая модель почти всегда предлагала одно и то же – связать две уже существующие работы между собой.
Схема эксперимента исключала подгонку тем. Учёные взяли опубликованные статьи с конференций ICLR, ICML и NeurIPS за 2023–2026 годы, а также из журнала Nature Communications за 2023–2025 годы, охватив 71 научную дисциплину, включая физику, химию и биологию. Всего в выборку попали 11 683 человеческие идеи.
Дальше идею каждой статьи разбирали до исходных условий. Для каждой работы восстанавливали от 4 до 8 близких предшествующих исследований, от которых оставляли только заголовки и краткие описания. Именно этот набор и получала модель с просьбой придумать новую идею в том же формате, где отдельно указывалась мотивация и отдельно метод.
Оценивали результат по двухосной таксономии "исследовательского вкуса".
Одна ось описывает, зачем работа вообще нужна, и включает противоречие, пробел в объяснении, несовпадение области, нехватку данных, разрыв между направлениями, риск сбоя и нехватку ресурсов.
Вторая ось описывает, как из пробела вырастает вклад, от синтеза и расширения области до формального вывода, эмпирического картирования и создания системы, а саму таксономию собрали, изучив рекомендации NSF, NIH, AHRQ и DARPA.
Разрыв оказался огромным. Мотивацию через связывание разрозненных работ выбрали лишь 12,1% человеческих идей, тогда как у девяти моделей эта доля составила от 47,1 до 64,2%, а синтез или унификацию как главный метод люди применяли в 5,1% случаев против 22,5–38,7% у моделей.
Разнообразие идей мерили нормированной энтропией. У людей она превысила 0,92 по обеим осям, а у моделей опустилась до 0,550–0,758 по оси возможностей и до 0,723–0,879 по оси методов. Ближе всех к людям по первой оси оказалась Gemini 3.1 Pro, но и у неё пришлось бы переместить больше трети распределения, а по оси методов лучшей стала Claude Sonnet 4.6.
Ставка на рассуждения только ухудшила картину. У Qwen3-8B включение режима размышления подняло долю связывающих идей с 49,7 до 71,1%, а явного синтеза – с 38,7 до 52,2%, при этом энтропия упала с 0,658 до 0,481. Та же тенденция проявилась у DeepSeek-V4-Flash, так что размышление не расширяет распределение, а лишь затачивает любимый шаблон модели.
Не помог и более богатый контекст. В отдельной проверке моделям давали полные тексты работ вместо кратких описаний, и обе испытуемые системы отдалились от человеческого распределения ещё сильнее.
Разбор механизма показал конкретный "рецепт". Так, глагол "интегрировать" встретился в идеях моделей 7 994 раза, что составило 34,2%, против 275 упоминаний у людей, то есть 2,35%, а после идут "унифицировать", "объединить" и "адаптировать".
Для сравнения, люди гораздо чаще берутся заменить, развязать или формализовать что-то конкретное – "заменить" встречается у них в 9,13% случаев против 0,92% у моделей.
Самое любопытное наблюдение касается родства моделей. По одной и той же статье идеи Qwen3-8B и DeepSeek-V4-Flash оказались похожи друг на друга сильнее (0,8316), чем каждая из них на человеческую (0,7242 и 0,7829 соответственно). Две системы разных разработчиков сходятся к одному способу мыслить.
Дело при этом не только в качестве. Отдельные оценки показали, что большинство моделей уступают людям в точности формулировки узкого места и выдают больше общих фраз, но Claude Sonnet 4.6 стала исключением и обошла человеческий уровень по обоим показателям, оставшись при этом смещённой по распределению.
Ограничения исследователи признают сами. Выборка сосредоточена на научных областях, задача сводит идею к одному запросу без диалога, а живой учёный опирается ещё и на неявный опыт, провальные попытки, сотрудничество и отзывы рецензентов.
Интерактивные агенты, узкоспециализированные системы и поисковые схемы могут часть разрыва сократить, однако если требуются действительно оригинальные идеи – пока стоит обращаться к людям.