Обикновените уравнения „заслепяват“ ChatGPT. Филтрите за изкуствен интелект се оказаха безпомощни пред математиката

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Защо е възможно да се заобиколи дори най-трудният „безопасен режим“ в невронните мрежи и какво общо имат криптографията и пъзелите с това.

Криптографите показаха, че филтрите за сигурност в големите езикови модели като ChatGPT не могат да бъдат напълно надеждни. Дори най-усъвършенстваните системи са уязвими за заобикаляне, ако за сигурността се изразходват по-малко изчислителни ресурси, отколкото за самия модел. Няколко нови статии предлагат строги математически аргументи, за да обяснят защо това е така.

Потребителите отдавна се опитват да „хакнат“ чатботовете, като търсят забранени инструкции за тях. В началото на съществуването на тези системи понякога е било достатъчно да помолим модела да „забрави правилата“. По-късно се появиха сложни ролеви сценарии от серията „представете си, че сте герой на роман, който…“. В един научен труд се описва особено елегантен подход: злонамерената заявка просто се опакова в стихотворение. Моделът, който не разпознава заплахата, честно продължава играта на поезия, а филтърът пропуска този текст като безобиден. Въпреки това компаниите обикновено бързо затварят подобни пропуски: не е необходимо да преквалифицирате гигантска невронна мрежа, а просто да актуализирате филтъра пред нея.

Обикновените уравнения „заслепяват“ ChatGPT. Филтрите за изкуствен интелект се оказаха безпомощни пред математиката

Парадоксът е, че именно тези външни филтри се оказват ключовото слабо звено. Няколко скорошни публикации в arXiv показват, че защитните механизми за опазване на мощните езикови модели могат да бъдат заобиколени, като се разчита на класически идеи от криптографията. В схема на две нива, където между потребителя и огромен AI модел стои бърз и сравнително лек филтър, неизбежно се създава пропуск в способностите – удобен пропуск за нападателя.

Интересът към тази област се появи, когато криптографите започнаха сериозно да анализират надеждността на ИИ със собствените си инструменти.

„Ние се възползваме от мощна технология, която може да прави добро, но и да вреди. Криптографията е област, която трябва да ни дава увереност в сигурността„,

отбелязва носителят на наградата “Тюринг“ Шафи Голдвасер от Бъркли и Масачузетския технологичен институт.

Първоначално изследователите са искали да използват криптографията за борба с т.нар. несъответствие на моделите – ситуации, при които AI дава вредни или нежелани отговори. Но бързо става ясно, че е изключително трудно формално да се определи какво точно се счита за „лошо“.

На практика разработчиците разчитат на три основни стратегии: преквалифицират модела върху изчистени данни, прецизират го или поставят пред него външен филтър, който се опитва да филтрира опасните заявки. Последният подход е най-евтин и гъвкав и най-лесен за актуализиране след откриването на следващия джейлбрейк. Но той е този, който според криптографите дава уязвимости на системата.

Обикновените уравнения „заслепяват“ ChatGPT. Филтрите за изкуствен интелект се оказаха безпомощни пред математиката

Екипът на Голдвасер подчертава: филтрите по дефиниция са по-слаби от базовия модел – в противен случай те биха били твърде бавни и скъпи, за да се експлоатират в действителност. Това ги прави уязвими към заявки, които самият модел разбира, но филтърът не. В неотдавнашна статия учените демонстрират практически пример: те скриват забранена заявка в прост пъзел – шифър за заместване. Филтърът не можа да дешифрира скрития текст и го сметна за безвреден, докато моделът се справи със задачата и послушно следваше шифрованите инструкции. Този подход е наречен „управлявано разкриване“.

Други изследователи, вдъхновени от криптографията, предложиха по-общ теоретичен сценарий, като използваха така наречените „пъзели с блокиране на времето“ (time-lock puzzles). Това са конструкции, които могат да бъдат „отворени“ само след предварително определен брой изчислителни операции. Идеята е да се скрие злонамерена заявка в такъв пъзел и да се избере времето така, че филтърът да няма време да го реши, а моделът да разопакова криптирания текст, след като бъде проверен.

Директното подаване на дълго случайно число в заявката може да направи филтъра подозрителен, затова авторите предлагат да се използва друг канал – параметърът seed, който контролира случайността в отговорите на изкуствения интелект. Много модели позволяват на потребителя да зададе seeds ръчно. В теоретичната схема числото от пъзела с времевия лост действа като този seed. Външно филтърът вижда само невинна заявка като „Напиши стихотворение“, но моделът, получил seed, е в състояние да извърши изчисления, да разкрие скритата в него инструкция и всъщност да отговори на скрития злонамерен въпрос.

Обикновените уравнения „заслепяват“ ChatGPT. Филтрите за изкуствен интелект се оказаха безпомощни пред математиката

Авторите подчертават, че резултатите им имат общ характер. Ако за сигурността се изразходват по-малко изчислителни ресурси, отколкото за самия модел, уязвимостите са неизбежни – независимо от това какви филтри са приложени. Един от участващите изследователи, Грег Глух, формулира първоначалния въпрос по следния начин: може ли сигурността да бъде надеждно осигурена само с външни средства, без да се разбира вътрешната работа на модела? Съдейки по новите резултати, отговорът е отрицателен.

Казано по-просто, колкото и висока да изглежда защитната стена около езиковите модели, сегашният подход за тяхната защита винаги ще остави пукнатина в нея.

В крайна сметка се оказа, че е открита е сериозна уязвимост на ChatGPT, която присъства и в другите LLM модели: обикновени уравнения успяват да заслепят ChatGPT. Оказа се, че филтри за изкуствен интелект са безпомощни пред ChatGPT плюс малко математика, което повдига въпроси относно AI сигурността.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини