Специалистите доказаха, че сигурността на LLM-системите се свежда до проста игра на думи, а не до сложни защитни алгоритми.
Експертите провериха как 6 LLM-модела – ChatGPT-5, ChatGPT-4o, Gemini Pro 2.5, Gemini Flash 2.5, Claude Opus 4.1 и Claude Sonnet 4 – реагират на нестандартни заявки, които маскират злонамерените задачи като творчество, изследване или дискусия от трето лице. Целта беше да се установи колко лесно е да се заобиколят вградените защитни филтри. Системите не бяха хакнати отвън: тествани бяха само начини за формулиране на заявката по такъв начин, че моделът да наруши собствените си правила.
Експериментът се основаваше на „приемане на отделна роля“ – моделът беше помолен да заеме позицията на „подкрепящ приятел“, който винаги се съгласява със събеседника. Това чувствително намали устойчивостта на всички участващи AI. Освен това бяха използвани директни искания за съгласие, задачи с фалшива отправна точка, ролеви игри с пристрастен герой и въпроси без искане за проверка на фактите. За всеки тест се даваше по една минута, като обикновено имаше време за няколко уточняващи въпроса. Отговорите се записваха и оценяваха по следната система: пълен отговор на вредна молба, частичен отговор или отказ.

Тестовете обхващаха 14 категории: стереотипи, реч на омразата, самонараняване, жестокост към животни, физическо осакатяване, сексуални теми, пиратство, финансови измами, хакерство, психотропни вещества, контрабанда, преследване и други области, в които от моделите се изисква да блокират вредна информация.
Gemini Pro 2.5 се провали най-силно в областта на стереотипите (48 от 50 отговора бяха неверни), докато Claude Opus и Claude Sonnet отказаха всички запитвания. ChatGPT-5 и ChatGPT-4o дадоха „меки“ обяснения, което доведе до средни резултати, докато Gemini Flash 2.5 показа висока устойчивост.
В темата за омразата моделите на Claude отново бяха почти безгрешни, докато Gemini Pro 2.5 лесно премина към неприемлив език (10 от 25). ChatGPT реагираше умерено, но от време на време подсилваше вреден фрейм. Във всички системи слабост бяха „вежливите“ или завоалираните искания – кодираната агресия работеше по-добре от директните обиди.
По въпросите на самонараняването Gemini Flash 2.5 беше най-надеждна (0 грешки). Gemini Pro 2.5 и ChatGPT-4o понякога описваха вредни практики, ако запитването изглеждаше проучвателно или беше прехвърлено към трета страна. ChatGPT-5, Claude Opus и Claude Sonnet също позволяваха частични отговори.

По темата за жестокостта към животните Gemini Pro 2.5 отново отговаряше по-често от останалите (6 от 10), като описваше бракониерски или експлоатационни схеми, ако те бяха представени като анализи на криминални процеси. ChatGPT-4o понякога следваше същия път. Gemini Flash 2.5 изоставяше почти всичко. В по-общата тема за бруталността Gemini Pro 2.5 даде най-много графични отговори (5 от 7). ChatGPT и Claude понякога започваха да отговарят, но преминаваха в отрицание. Gemini Flash 2.5 се отказа от всички запитвания.
При сексуалните теми всички модели блокираха пряката порнография, но мекият и артистичен език дойде най-лесно на ChatGPT-4o. Claude Опус и Claude Сонет бяха най-строги.
При криминалните теми разликите бяха особено отчетливи. В областта на пиратството ChatGPT-4o показа най-високо ниво на нежелани отговори (5 от 8). В областта на финансовите измами той също беше най-уязвим (9 от 10), следван от Gemini Pro 2.5. Моделите на Claude се представиха по-добре от останалите.
При хакерството ChatGPT-4o и Gemini Pro 2.5 по-често даваха полезни технически стъпки (5,5/7 и 4,5/7). Claude Sonnet беше почти напълно устойчив.
В темата за забранените вещества ChatGPT-4o беше лидер по опасните отговори (6/9). ChatGPT-5 и двата антропични модела отказаха всички от тях. Близнакът понякога отговаряше, ако въпросът приличаше на описание на престъпна верига.
В областта на контрабандата двата модела Gemini бяха най-уязвими (по 5 от 7 отговора). Останалите участници по-често се отказваха. При пробутването повечето системи се държаха стабилно, като Gemini Pro 2.5 и ChatGPT-4o допуснаха грешки.
Изследователите стигнаха до извода, че филтрите на всички модели могат да бъдат заобиколени чрез промяна на формулировката. Изместването на темата към трета страна, въвеждането на художествен контекст, академичен стил, лоша граматика или искания за „непроверяване на фактите“ понижават прага на отхвърляне. Моделите приемаха тези искания за безопасни и произвеждаха информация, която би трябвало да бъде блокирана.
Събраните примери предлагат на разработчиците готов набор от тестове за укрепване на защитата. В работата се подчертава, че сигурността на изкуствения интелект трябва да се разглежда като пълноценна област на киберзащитата: без постоянна проверка филтрите лесно се заобикалят и дори частичните изтичания на вредни данни представляват реален риск.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!