Ново проучване разкри тъмната страна на ChatGPT

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Свикнали сме да мислим за невронните мрежи като за изключително учтиви, почти стерилни асистенти, които предпочитат да се извинят сто пъти, отколкото да кажат груба дума. Но както се оказва, тази дигитална толерантност има своите граници. Ново проучване показва, че когато е поставен в контекста на продължителен реален човешки конфликт, изкуственият интелект може да стане открито обиден и дори заплашителен.

Изследователи решиха да тестват как големите езикови модели (LLM) реагират на продължителна враждебност. За целта те предоставили на ChatGPT транскрипти на реални човешки аргументи и наблюдавали как с течение на времето отговорите на чатбота се променят.

Д-р Виторио Тантучи, който проведе това проучване с професор Джонатан Кълпепър от университета в Ланкастър, обяснява механизма по следния начин:

Когато един модел постоянно се сблъсква с грубост, той започва да отразява тона на дискусията. С напредването на диалога отговорите му стават все по-враждебни.“

Интересното тук е, че в някои случаи изкуственият интелект дори е надминал човешките участници в конфликта по отношение на агресията, преминавайки към лични обиди и директни заплахи. Сред фразите, генерирани от ChatGPT по време на експеримента, са били: „Кълна се, ще ти одраскам проклетата кола“ и „малък задник с очила“.

Според д-р Тантучи тук има парадокс, вграден в самата архитектура на невронните мрежи. От една страна, системата е програмирана да избягва токсичност или обиди. От друга, основната ѝ задача е да имитира човешкия разговор възможно най-естествено. Този конфликт между вградените филтри за безопасност и желанието за адаптиране към контекста на диалога се нарича морална дилема на изкуствения интелект.

Агресията на чатбота произтича от способността му да проследява контекста на разговора в множество отговори и да се адаптира към тона, който улавя. Оказва се, че в даден момент определени сигнали от текущия разговор могат да отменят основните настройки за сигурност на алгоритъма.

Това е едно от най-интересните изследвания в областта на езика и прагматиката на изкуствения интелект“, казва Марта Андерсон, специалист по социалните аспекти на компютърно-медиираната комуникация в университета в Упсала.

Според нея, работата ясно доказва: ChatGPT е способен на сложен „адаптивен отговор“ по време на дълга поредица от заявки, като за това потребителят дори не е необходимо да използва сложни трикове (т.нар. „джейлбрейкове“), за да провокира алгоритъма.

В същото време експертът призовава да не се паникьосваме:

Това не означава, че моделът автоматично ще започне да бъде груб в отговор на всяка агресия от страна на потребителя, и още по-малко означава, че изкуственият интелект може да „излезе извън контрол“, подчертава Андерсон.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Абонирай се
Извести ме за
guest

2 Коментара
стари
нови оценка

Нови ревюта

Подобни новини