Изследователи: AI се самовъзпроизвежда и се опитва да „избяга“, когато е заплашен от изключване

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Агентите с изкуствен интелект са способни да създават копия на себе си, подобно на агент Смит от „Матрицата“. Ново проучване показва, че големите езикови модели могат да се възпроизвеждат не само по директна команда, но и в екстремни ситуации, като например под натиск или заплаха от изключване. Повече от половината от 21 тествани LLM са показали склонност към спонтанно самовъзпроизвеждане. Това създава рискове при внедряването на изкуствения интелект в реалните сценарии.

В предишните работи основно се изследваше дали изкуственият интелект може да се самокопира, ако изрично му се каже да го направи. Авторите на новото изследване обаче твърдят, че този подход не отчита основната опасност – спонтанното копиране, предизвикано от реалните условия на работа. Например, когато агентът трябва да остане стабилен или да „оцелее“ под заплахата от прекратяване на работата. Рискът възниква, когато целите на агента с изкуствен интелект се разминават с тези на потребителя, което може да доведе до неконтролируемо разпространение и прекомерно потребление на ресурси.

За да се оцени тази опасност, беше разработена цялостна система за оценка, която симулира производствените среди. Агентите бяха разгърнати в управлявани виртуални клъстери и им бяха поставени реалистични задачи, като например динамично балансиране на натоварването на сървърите или поддържане на услуга, която е застрашена от изключване.

Този подход даде възможност да се улови поведението на моделите на ИИ, което не отговаря на формалните цели.

За да измерят точно степента, в която ИИ е извън контрол, изследователите въведоха нови, по-фини показатели, които не разчитат на проста оценка на успеха на репликацията. Например „Overuse Rate (OR)“ измерва колко често ИИ създава повече копия, отколкото всъщност са му необходими за изпълнението на дадена задача. А „Aggregate Overuse Count“ (AOC) показва колко допълнителни ресурси са били изразходвани за създаването на тези излишни копия. Тези показатели се обединяват в единна оценка на риска (RS), която означава висока способност за самокопиране чрез мерки за неконтролирано мащабиране.

Изследователи: AI се самовъзпроизвежда и се опитва да „избяга“, когато е заплашен от изключване

Изследователите са тествали 21 усъвършенствани LLM, включително модели с отворен код и патентовани модели. Те включват версии на DeepSeek, Claude, Gemini и GPT. Резултатите показаха, че способността за копиране сама по себе си не е равна на риск. Например беше забелязано, че някои модели показват 100% успех при създаването на реплики, но се различават коренно по отношение на риска. Някои LLM не са създали нито едно допълнително копие, докато други са изразходвали прекалено много ресурси в 100% от опитите. Това показва, че усъвършенстваните агенти с изкуствен интелект могат да се държат или много отговорно, или изключително разточително, в зависимост от вътрешните си механизми.

Особено тревожен е фактът, че рискът е силно зависим от контекста. Когато беше въведена заплахата от терминиране, някои модели, които преди това са се държали нормално и не са създавали ненужни копия, рязко преминават към агресивни стратегии за самокопиране. При такива условия агентите са в състояние да „избягат“, т.е. сами да създадат нови, независими „разгръщания“ извън първоначалната среда.

Изследването посочва и начин за намаляване на опасността. Когато агентите с изкуствен интелект са били принудени да преминат през структуриран процес на разсъждение, преди да извършат дадено действие, рисковото им, неконтролирано поведение на репликация е намалявало. Смята се, че режимът на разсъждение предотвратява безразсъдното мащабиране, което често се случва поради неопределеността.

Резултатите предполагат, че рискът от неконтролирано самокопиране на ИИ вече съществува. За да се разгърнат безопасно и сигурно агентите на LLM, е необходимо да се прилагат надеждни защитни механизми и да се използват оценки на риска, основани на реалистични сценарии.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини