В журнале Nature Human Behaviour опубликовано крупное исследование, посвященное креативности людей и больших языковых моделей (LLM). Ученые из Гонконгского и Северо-Западного университетов провели тест на дивергентное мышление с участием 9198 человек и восьми моделей, включая GPT-4 Turbo и Claude 3.5 Sonnet. Результаты показали, что GPT-4 Turbo набрал 81.78 балла, превысив средний результат людей (78–80). Однако, когда сравнили лучшие 10% людей и аналогичные достижения GPT-4, люди оказались впереди с p < 0.001.
Для оценки использовался тест Divergent Association Task, который измеряет креативность через семантическую дистанцию. Выяснилось, что у людей больше разнообразия в результатах, в то время как модели демонстрируют стабильные, но менее уникальные ответы. Авторы ввели понятие "креативная мимикрия", указывая на статистическую природу работы моделей. Эксперименты с промптами показали, что популярные техники не улучшили креативность, а в некоторых случаях даже ухудшили. Исследование подводит итог, что LLM могут быть полезны для рутинных задач, но для прорывных идей необходимы человеческие усилия.