Мащабно проучване на човешката креативност и големите езикови модели беше публикувано в списание Nature Human Behavior. Учени от Университета на Хонконг и Северозападния университет сравниха 9198 души с осем LLM на тест за дивергентно мислене — общо 215 542 изпълнения от ИИ-моделите. Резултатите бяха смесени: GPT-4 Turbo е постигнал 81,78 точки, надминавайки средния човешки резултат (78–80 точки), Claude 3.5 Sonnet е постигнал 80,01, а китайският Ernie 4.0 се е представил най-зле със 76,17 точки. Когато обаче изследователите сравнили първите 10% от хората с първите 10% от отговорите на GPT-4 Turbo, хората излезли победители със статистическа значимост (p < 0,001).
За оценката е използван Divergent Association Task — тест, в който се назовават 10 съществителни, които са възможно най-различни. Креативността се измерва алгоритмично чрез семантичното разстояние между думите, без субективни оценки от жури. Това е от решаващо значение: за първи път нито хората, нито студентите по право се оценяват взаимно. Основната разлика се оказва не в средните резултати, а в разпределението. Хората имат значително по-висока дисперсия — има както слаби, така и изключителни резултати — докато моделите произвеждат стабилна средна позиция. Освен това хората генерират значително повече уникални думи: между сесиите моделите повтарят едни и същи отговори, като например “щастие“ и “свобода“.
Авторите въвеждат термина „творческа мимикрия“, за да опишат как LLM симулират оригиналност. Моделите използват две стратегии: извличане на редки думи от корпуса или разчитане на температурния параметър за въвеждане на случайност. Това обаче не е разбиране на значението, а по-скоро статистическа манипулация. Примерът с Claude е илюстративен: при ниска температура моделът е произвел думата „zephyr“ 485 пъти от 750 изпълнения, но при висока температура е произвел думата „freedom“ само 38 пъти. GPT моделите първоначално подобряват резултатите си с повишаване на температурата, но след това започват да халюцинират, генерирайки безсмислени или изкривени думи.
Отделен експеримент демонстрира провала на популярните техники за промптинг. Инструкциите „мисли като Стив Джобс“ не са подобрили креативността — всъщност резултатите са спаднали. Авторите обясняват това, че моделът стеснява речника до областта, свързана с персоната, вместо да прегърне нейната „гениалност“. Резултатите са още по-лоши с демографските сигнали: подканата „мисли като жена“ е намалила резултатите, „мисли като по-възрастен човек“ ги е увеличила (свързано с по-голям речник), а „мисли като чернокож“ значително ги намалява, което авторите директно отдават на вградените в моделите социални стереотипи.
Практическото заключение на изследователите: LLM са подходящи като отправна точка за рутинни творчески задачи и помагат за бързото достигане на средно ниво. Въпреки това, за пробивните идеи все още се изискват хора.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!