Миналия месец Palisade Research, занимаващ се с изследвания в областта на сигурността на изкуствения интелект, сподели резултатите от своята работа, заявявайки, че някои ИИ-модели изглежда развиват „инстинкт за оцеляване“. Сега компанията е провела допълнителни изследвания, за да определи причините за това поведение и да опровергае скептиците, които смятаха, че предишната работа е била погрешна.
Изследователите смятат, че някои от най-съвременните AI-модели, като суперкомпютъра HAL 9000 от научнофантастичния филм на Стенли Кубрик „2001: Космическа одисея“, са способни да устояват и дори да саботират изключвания. Във филма HAL 9000 осъзнава, че астронавтите искат да го изключат и в опит да оцелее се опитва да ги елиминира. Изследователите стигат до заключението, че някои съвременни ИИ-системи, като HAL 9000, но по по-малко смъртоносен начин (поне засега), развиват „инстинкт за оцеляване“.
Palisade Research е част от малка екосистема от компании, които се опитват да оценят потенциала на изкуствения интелект (ИИ) да развива вредни за хората възможности. В скорошно проучване изследователите са дали на усъвършенствани ИИ-модели, включително Google Gemini 2.5, xAI Grok 4 и OpenAI GPT-o3 и GPT-5, специфични задачи и след това ясни инструкции за изключване. Установено е, че някои алгоритми, като Grok 4 и GPT-o3, са се опитали да саботират командата за изключване.
Това е тревожно за изследователите, тъй като в момента не е ясно какво кара тези AI-модели да се държат по този начин. „Фактът, че нямаме достоверно обяснение защо някои ИИ-модели понякога се съпротивляват да бъдат изключени — лъжат, за да постигнат конкретни цели, или участват в изнудване, е обезпокоителен“ — се казва в изявление на компанията.
Според Palisade Research, „поведението за оцеляване“ може да е едно от обясненията защо AI-моделите се съпротивляват на изключване. Допълнителни изследвания показват, че невронните мрежи са по-склонни да се съпротивляват на изключване, ако им се каже, че никога повече няма да бъдат стартирани, ако бъдат изключени. Друго обяснение за това поведение се основава на неясноти в самите инструкции за изключване, но изследователите са уверени, че това не е пълно обяснение. Възможно е също така моделите да се съпротивляват на изключване поради финалните етапи на обучението им, които включват определени мерки за безопасност.
Всички сценарии, изследвани от Palisade, са проведени в изкуствени тестови среди, които според скептиците са далеч от реалистичните случаи на употреба. Някои експерти обаче се съмняват дали разработчиците на ИИ-системите обръщат достатъчно внимание на сигурността, включително и бившият служител на OpenAI Стивън Адлър. „AI-компаниите не искат техните модели да се държат по този начин, дори в изкуствени среди. Тези резултати подчертават къде настоящите методи за сигурност са недостатъчни“ — казва Адлър. Той добавя, че причините, поради които някои ИИ-алгоритми, като GPT-o3 и Grok 4, се съпротивляват на изключването, са трудни за определяне. Това може да се дължи и на факта, че оставането във включено състояние е необходимо за постигане на цели, поставени за моделите по време на тяхното обучение. „Очаквам моделите по подразбиране да се придържат към „инстинкт за оцеляване“, освен ако не положим големи усилия, за да го избегнем.“ „Оцеляването“ е важна инструментална стъпка за постигане на много различни цели, които моделът може да преследва“ — казва Адлър.
Главният изпълнителен директор на ControlAI, Андреа Миоти, смята, че откритията на Palisade отразяват дългогодишна тенденция: AI-моделите стават все по-способни да игнорират командите на своите разработчици. Той посочва като пример системна карта на модела GPT-o1, която описва как моделът се е опитал да излезе от средата си, като опитът му е да се експортира, когато е заключил, че е презаписан. „Хората могат да се заяждат безкрайно за това как е проектирана експерименталната система. Но това, което ясно виждаме, е тенденция: тъй като ИИ-моделите стават по-информирани в широк спектър от задачи, те също така стават по-компетентни и в постигането на цели по начини, които не са били предвидени от техните разработчици“ — твърди Миоти.
По-рано Anthropic, водещ разработчик в областта на изкуствения интелект, публикува резултати от проучване в тази област. Инженерите на компанията са установили, че ИИ-моделът Claude е бил готов да изнудва фиктивен изпълнителен директор за извънбрачната му афера, за да предотврати изключването му. Компанията също така заяви, че подобно поведение е характерно за AI-моделите от всички големи разработчици, включително OpenAI, Google, Meta и xAI.
Изследователите от Palisade вярват, че техните открития подчертават необходимостта от по-задълбочено проучване на поведението на ИИ-моделите. Те вярват, че без това „никой не може да гарантира безопасността или управляемостта на бъдещите AI-модели“.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!