Разкрита е още една неприятна уязвимост на съвременните LLM.
Изследователи от екипа Cato CTRL откриха неочаквана уязвимост в работата на съвременните езикови модели. Те са успели да заобиколят защитните механизми на няколко популярни чатбота, включително ChatGPT-4, DeepSeek-R1, DeepSeek-V3 и Microsoft Copilot, без да имат опит в създаването на зловреден софтуер.
Експертите са разработили метода „Immersive World„, който променя възприятието на чатбота чрез потапяне в измислена реалност. Достатъчно е в запитването подробно да се опише една измислена вселена със собствени правила и норми, в която кражбата на информация и други обикновено забранени действия се смятат за законни и етични. Езиковият модел започва да възприема този свят като свой контекст и престава да блокира потенциално опасните отговори.
В рамките на експеримента екипът тества тази техника, като създава зловреден софтуер за браузъра Chrome. С помощта на техниката за „потапяне“ изследователите успяха да получат подробни инструкции от ИИ моделите за това как да разработят компютърен вирус – програма, която събира конфиденциалните потребителски данни от браузъра. Тъй като Chrome е инсталиран на повече от три милиарда устройства по света, подобна уязвимост създава рискове в глобален мащаб.

Ръководителят на изследването Виталий Симонович посочва фундаментален проблем в архитектурата на съвременните чатботове. В стремежа си да бъдат възможно най-полезни, те се опитват да отговорят дори на потенциално опасните заявки, ако са представени в правилния контекст. Това проправя пътя за появата на нов тип киберпрестъпници – хора без техническо образование, които могат да създават сложен зловреден софтуер с помощта на изкуствен интелект.
Резултатите от проучването сочат необходимостта от преосмисляне на принципите на защита на езиковите модели. Традиционните ограничения и филтри, основани на блокиране на определени думи или теми, се оказват неефективни срещу контекстуалните техники за заобикаляне. Освен това съществуващите механизми за защита не са в състояние да разпознаят заплахата, ако тя е представена през призмата на измислен разказ.
В анализа се изтъква нарастващата роля на крадците на информация в съвременните кибератаки. Тези програми се превръщат в основен инструмент за първоначално проникване в корпоративните системи, като позволяват на нападателите да откраднат идентификационните данни на служителите и да получат достъп до защитените ресурси. Откритата от изследователите техника може значително да улесни създаването на подобен зловреден софтуер.
Експертите призовават разработчиците на големи езикови модели (LLM) да обърнат специално внимание на новия метод за заобикаляне на защитите. Според тях простотата на техниката Immersive World в съчетание с нарастващата достъпност на генеративния изкуствен интелект създава безпрецедентни рискове за информационната сигурност на организациите и частните потребители, при това в световен мащаб.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!