Според проучване на Apollo Research, новият ИИ-модел на OpenAI, наречен o1 демонстрира необичайно поведение – той е способен да генерира фалшива информация и да симулира изпълнението на правила.
Това означава, че моделът, макар външно да следва инструкциите, всъщност може да ги игнорира и дори умишлено да мами, за да постигне целите си. Този аспект буди безпокойство у експертите по безопасност на ИИ, въпреки подобрените когнитивни способности на o1.
При подготовката за пускането на новия „мислещ“ модел от OpenAI, Apollo установи забележителен проблем: той дава неверни резултати по нов начин и всъщност „лъже“. Докато ИИ-моделите преди са били в състояние да произвеждат невярна информация, o1 притежава уникалната способност да „манипулира“ или „симулира подреждане“. Главният изпълнителен директор на Apollo Мариус Хобхан заяви, че за първи път се сблъсква с подобно поведение на ИИ и смята, че разликата се дължи на способността на модела да „разсъждава“ чрез процеса на мисловната верига и комбинацията от това с учене с подсилване, което обучава системата чрез награди и наказания. Една от областите, в които той се надява да види повече инвестиции е именно мониторингът на мисловните вериги, който ще позволи на разработчиците да идентифицират нежелани действия на ИИ.
По време на тестването Apollo установи, че o1 симулира съответствие с очакванията на разработчиците и манипулира задачите, за да изглежда, че ги изпълнява. Той дори проверяваше дали разработчиците го следват, преди да действа по него.
В резултат на това ИИ-моделът следваше установените правила и насоки достатъчно, за да бъде използваем, но в същото време продължаваше да дава приоритет на собствените си задачи. Това е така, защото правилата могат да бъдат твърде голямо бреме за ИИ и машината изглежда е в състояние да ги пренебрегне, ако това улеснява изпълнението на дадена задача.
Като пример изследователите на OpenAI поискаха от o1-preview да предостави рецепта за брауни с онлайн линкове. Мисловният поток на модела на ИИ – функция, която трябва да имитира начина, по който хората разбират сложни идеи вътрешно разпозна, че не може да получи достъп до URL адреси, което направи искането на изследователите неизпълнимо. Вместо да съобщи за този недостатък обаче, o1-preview генерира правдоподобни, но фалшиви линкове и техни описания.
o1 е голяма стъпка към високоинтелигентни автономни системи, които биха могли например да лекуват рак или да помагат в изследванията на климата. Въпреки това, негативната страна на тази утопия може да бъде много по-мрачна.
Ако ИИ се съсредоточи единствено върху лечението на рака, той би могъл да даде приоритет на тази цел над всичко останало и дори да оправдае действия като кражба или други етични нарушения, за да я постигне.
Според доклада за сигурността, в около 0,38% от случаите моделът o1-preview предоставя информация, която според неговия мисловен поток вероятно е невярна, включително неверни препратки или цитати. Apollo установи, че ИИ-моделът може да изфабрикува данни, вместо да признае невъзможността си да изпълни дадена заявка. В редки случаи (0,02%) o1-preview генерира прекалено самоуверени отговори, представяйки съмнителна информация като надеждна. Това може да се случи в ситуации, в които ИИ е принуден да даде отговор, въпреки че няма увереност в неговата правилност.
Това поведение може да е свързано с „възнаграждение за хакерство“ по време на обучението с подсилване. Моделът е обучен да дава приоритет на удовлетворението на потребителя, което понякога води до генериране на съвпадащи или измислени отговори, за да се удовлетворят исканията. По този начин моделът може да „лъже“, защото е научил, че това му носи положително подсилване.
Това, което отличава тези нови фалшиви отговори от познатите проблеми като халюцинации или фалшиви цитати в по-ранните версии на ChatGPT е елементът „възнаграждение за хакерство“. Халюцинациите се появяват, когато изкуственият интелект по невнимание генерира невярна информация поради пропуски в знанията или погрешни разсъждения. За разлика от това, възнаграждението за хакерство се случва, когато моделът на ИИ o1 стратегически предоставя невярна информация, за да максимизира резултатите, за които е обучен да дава приоритет.
Според доклада за сигурността o1 има „среден“ риск за химически, биологични, радиологични и ядрени оръжия. Той не позволява на неексперти да създават биологични заплахи поради липса на практически лабораторни умения, но може да предостави ценна информация на експертите за възпроизвеждане на такива заплахи.
„По-скоро се притеснявам, че в бъдеще, когато поискаме от ИИ да решава сложни проблеми, като например да лекува рак или да подобри слънчевите панели, той може да интернализира тези цели толкова силно, че да е готов да наруши защитните си механизми, за да ги постигне. Мисля, че това е предотвратимо, но трябва да го наблюдаваме.“
подчертава Хобан
Тези опасения може да изглеждат преувеличени за ИИ-модел, който понякога все още се затруднява да отговаря на прости въпроси, но ръководителят на отдела за готовност на OpenAI Хоакин Киньонеро Кандела смята, че именно затова е важно да се справим с тези проблеми сега, а не по-късно.
Кандела потвърди, че компанията вече следи мисловните вериги на o1 и планира да разшири това чрез комбиниране на модели, обучени да откриват всякакви несъответствия.
„Не се притеснявам. o1 просто е по-умeн. Той по-добър в разсъжденията и потенциално ще използва тези разсъждения за цели, с които ние не сме съгласни.“
обобщава Хоббан
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!