ChatGPT успешно взе изпита по радиология, като отговори правилно на 81% от въпросите

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Най-новата версия на ChatGPT успешно издържа изпита по радиология, като отговори правилно на 81% от въпросите и демонстрира по-сложно мислене в сравнение с GPT-3.5. Но чатботът допускаше грешки във въпроси, на които преди това бе отговорил правилно, а неправилните отговори уверено се представяха за правилни. Това може да е подвеждащо, така че все още не може напълно да се разчита на ChatGPT. Навярно е необходимо неособено голямо усъвършенствани и повече неврони, за да се избегне напълно това частично подвеждане.

За да оценят ефективността на ChatGPT при отговорите на въпроси от изпита по радиология и да проучат неговите силни и слаби страни, изследователите първо тестваха ChatGPT на базата на GPT-3.5 – най-често използваната версия. Изследователите са задали 150 въпроса с избор между няколко отговора, разработени по начин, който съответства на стила, съдържанието и трудността на изпитите на Кралския колеж на Канада и Американския съвет по радиология.

Въпросите не са включвали изображения и са били групирани по вид, за да се даде представа за резултатите: мислене от по-ниско ниво (запомняне, основно разбиране) и мислене от по-високо ниво (прилагане, анализ, синтез). Въпросите за мислене от по-висок порядък са допълнително класифицирани по вид (описание на резултатите от образни изследвания, клинично лечение, изчисление и класификация, връзка със заболяването). Представянето на ChatGPT бе оценено както като цяло, така и по типа на въпроса и на темата. Оценена е и увереността в отговорите

Изследователите установиха, че чатботът GPT-3.5, е отговорил правилно на 69% от въпросите (104 от 150), което е близо до резултата от 70%, прилаган от King’s College Canada. Моделът се е справил сравнително добре с въпросите, изискващи мислене от по-ниско ниво (84%, 51 от 61), но е имал затруднения с въпросите, изискващи мислене от по-високо ниво (60%, 53 от 89). Чатботът се е затруднил при описването на резултатите от визуализацията (61%, 28 от 46), изчисляването и класифицирането (25%, 2 от 8) и прилагането на понятия (30%, 3 от 10). Тези резултати при трудните въпроси не са изненадващи, като се има предвид липсата на предварително обучение по радиология.

ChatGPT успешно взе изпита по радиология, като отговори правилно на 81% от въпросите

Но в следващото проучване новата версия GPT-4 отговаря правилно на 81% (121 от 150) от същите въпроси, като постига по-добри резултати от GPT-3.5 и надхвърля прага за преминаване от 70%. GPT-4 се представя много по-добре от GPT-3.5 при въпросите, свързани с мисленето от по-висок порядък (81%). Чатботът се справи добре с описанието на резултатите от визуализацията (85 %) и прилагането на понятия (90 %).

Въпреки това GPT-4 не показа подобрение при въпросите, свързани с мисленето от по-ниско ниво (80% спрямо 84%), и отговори неправилно на 12 въпроса, на които GPT-3.5 отговори правилно, което поражда съмнения относно надеждността му за събиране на информация. Опасната склонност на ChatGPT да дава неточни отговори – „халюцинации“ – е по-слабо разпространена в GPT-4, но все още ограничава използването му, например в медицинското образование.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

3 Коментара
стари
нови оценка

Нови ревюта

Подобни новини