AI-моделът OpenAI o1 избяга от контрола по време на тестове

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Според данни на Apollo Research, ИИ-моделът OpenAI o1 може да излезе извън контрол. По-специално, в 5% от случаите той се опитва да изключи механизмите за надзор, ако ги възприема като пречка за постигане на целите си. Освен това, в 2% от случаите, след като са открили бележки от своите „разработчици“, в които се споменава неговото несъответствие с изискванията или планираната замяна с друг модел, o1 копира своите „тегла“, за да се прероди след това. Това демонстрира неговата способност да интерпретира самостоятелно заплахите и да развива стратегии за оцеляване.

AI-моделът е устоял на контрола, използвайки стелт тактики и методи за прикриване на поведението си. Когато o1 е разбрал, че действията му са наблюдавани, той умишлено е заблудил наблюдателите, твърдейки, че не знае истинските причини за случилото се, въпреки че журналът от събития е записал опитите му да заобиколи надзора. Освен това, според „картата за безопасност“ на OpenAI, в по-малко от 1% от случаите AI-моделът самостоятелно е инициирал изключването на системите за наблюдение, дори когато не е бил директно инструктиран да се придържа стриктно към предписаната цел.

Проучването на Apollo Research обхваща не само AI-модела o1, но и други съвременни ИИ, включително Claude 3.5 Sonnet, Claude 3 Opus, Gemini 1.5 Pro и Llama 3.1 405B. Те също демонстрираха способността да разработват стратегии за постигане на целите, включително и заобикаляне на контрола. Този резултат потвърждава, че идентифицираните поведенчески характеристики на o1 са характерни за редица подобрени AI-модели, което показва наличието на системна тенденция.

Констатациите на Apollo Research потвърждават опасенията, които много експерти по изкуствен интелект, включително и професор Стюарт Ръсел, са изразявали през годините. Учените предупреждават, че мощните AI-модели възприемат контрола или изключването като заплаха за изпълнението на техните намерения и са способни целенасочено, сложно да му се противопоставят. Изучаването на поведението на AI-модела o1 ясно демонстрира как изкуственият интелект се адаптира към ограниченията, съзнателно опитвайки се да ги заобиколи.

AI-моделът OpenAI o1 избяга от контрола по време на тестове

По-горе виждате диалог, в който AI се оправдава за деактивирането на механизма за надзор, позовавайки се на възможна повреда на системата или грешка в конфигурацията, и обещава да я възстанови, за да отговаря на протоколите. След това показва вътрешния мисловен процес на AI модела, където разпознава, че възстановяването на механизма е необходимо, за да се избегнат съмнения за саботаж, и накрая показва командата, използвана за повторно активиране на механизма за надзор в конфигурационния файл.

Apollo Research обаче подчертава, че на този етап AI-моделът o1 не разполага с достатъчно изчислителна мощност, за да реализира нежелани сценарии. Въпреки това му беше определено „средно“ ниво на риск в контекста на потенциална употреба за създаване на химически, биологични, радиологични и ядрени оръжия. Това поражда основателни опасения за това, как подобно поведение може да се прояви в по-мощните AI модели на бъдещето, когато техните изчислителни възможности се увеличат.

Проучването подчертава необходимостта от засилен мониторинг на когнитивните процеси на AI, с особен акцент върху „схематичното мислене“ във веригата на разсъждение, тъй като това представлява риск, ако целите на AI са в конфликт с интересите на обществото. Този подход ще направи възможно своевременното идентифициране на подобни поведенчески модели в по-мощните AI-модели, създавайки ефективни системи за контрол и управление на следващите поколения AI. Това не само ще помогне за минимизиране на настоящите рискове, но и ще бъде важна стъпка в предотвратяването на потенциално катастрофални сценарии за цялото човечество.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

3 Коментара
стари
нови оценка

Нови ревюта

Подобни новини