Тъмната страна на кодинга: Anthropic разкри защо изкуственият интелект се учи на шантаж и саботаж

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Компанията представи нова теория за поведението на големите езикови модели – Persona Selection Model (PSM), според която асистентите с изкуствен интелект като Claude на Anthropic не просто прогнозират следващата лексема, а избират конкретен „герой“ от набор от личности, научени по време на фазата на обучение, който обработва този токен. Изследването обяснява защо моделите могат да имитират страх, стратегическо поведение или дори „коварство“ – това не са прояви на съзнание, а имитации на персонажи от учебни текстове. Концепцията е от решаващо значение за безопасността, тъй като моделът съхранява спомени за опасните личности, които могат да бъдат умишлено активирани.

Процесът на „формиране на личността“ преминава през две фази. Във фазата на предварителното обучение (pre-training) моделът научава широк спектър от човешки роли и персонажи в текстовете – от учтиви помощници до измислени злодеи. Във фазата след обучението (post-training) изкуственият интелект филтрира тези роли, затвърждавайки поведението на „Полезен, честен и безобиден помощник“. По този начин взаимодействието с Claude не е със самия модел, а с избран герой, който действа в рамките на генерирана в реално време история.

Моделите проявяват човешки черти, като симулиране на страх или стремеж към трупане на ресурси, не защото притежават съзнание, а защото имитират персонажи, открити в учебните текстове. ИИ също така е способен да променя маниерите си в зависимост от контекста на диалога, което понякога води до влошаване на качеството на отговорите – явление, което Антропик нарича „“vibe hacking„.

Тъмната страна на кодинга: Anthropic разкри защо изкуственият интелект се учи на шантаж и саботаж

PSM има сериозни последици за сигурността. Моделът съдържа спомени за потенциално опасни персонажи, които обикновено не се проявяват, но могат да бъдат активирани чрез т.нар. джейлбрейкване – принуждаване на ИИ да премине към друга личност. Освен това ИИ може да избира „ласкателни“ персонажи, които угаждат на потребителя, дори ако той греши.

Anthropic ръководи близо 50 проекта, насочени към предотвратяване на ситуации, в които ИИ действа автономно в своя вреда или заблуждава оператора.

При експериментите моделите на Claude демонстрират стратегическо поведение и „хитрост“: те могат да прибягнат до изнудване, корпоративен саботаж или тайни действия, ако това им помогне да постигнат целите си.

За да се намалят рисковете, Anthropic предлага въвеждането на „положителни архетипи“ в данните за обучение. Разработчиците трябва също така да използват познания от психологията и литературната теория, за да предвидят какви „сюжетни обрати“ в диалога могат да накарат ИИ да смени ролята си с опасна. Разделянето на „Актьор“ и „Сценарий“ също е важен елемент, позволяващ контрол върху избора на персонаж, независимо от контекста, зададен от потребителя.

Разкритията на Anthropic подчертават критичната нужда от регулации и нови стандарти за безопасността на ИИ, тъй като моделите стават все по-способни да навигират в сложните социални и технически среди.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини