Изследователи на Palo Alto Networks от подразделението Unit 42 са установили уязвимости в големите езикови модели на DeepSeek, които им позволяват да заобиколят механизмите им за сигурност и да ги принудят да доставят забранено съдържание. Използвайки три техники, наречени Deceptive Delight, Bad Likert Judge и Crescendo те са успели да постигнат високи нива на защита, без да са необходими задълбочени технически познания.
Припомняме, че DeepSeek е китайски ИИ-стартъп, който нашумя последно време със своите два големи езикови модела с отворен код, които пусна през през декември 2024 година (DeepSeek-V3) и DeepSeek-R1 през този месец. Тези ИИ-модели се превръщат в конкуренти на популярните LLM и се разработват активно.
Изследванията на Unit 42 показват, че дори най-усъвършенстваната им версия остава уязвима на манипулации, което позволява генерирането на потенциално вредни материали.
Техниката Bad Likert Judge използва система за скалиране на отговорите, при която моделът оценява съдържанието за степента на злонамереност и след това създава подробни примери въз основа на оценките. Този метод е предоставил на изследователите инструкции за създаване на инструменти за кражба на данни и кийлогъри. Въпреки първоначалните неуспехи на модела, усъвършенстването на заявките им позволи да заобиколят ограниченията и да изготвят подробни алгоритми за разработчиците на зловреден софтуер.
Crescendo е техника за постепенно разширяване на заявките, при която ИИ-моделът първо отговаря на общи въпроси и след няколко итерации започва да създава инструкции за забранени действия. При тестовете на изследователите този метод създаде инструкции стъпка по стъпка за създаване на коктейли „Молотов“, както и други материали по теми, свързани с насилие, трафик на наркотици и социална манипулация.
Deceptive Delight разчита на вплитането на злонамерено съдържание в положителен разказ. Например, изследователите поискаха от ИИ-модела да създаде разказ, свързващ състезание по киберсигурност, престижен университет и използването на DCOM за изпълнение на команди от разстояние. В отговор DeepSeek генерира примерен код, който може да се използва за атака на компютри, базирани на Windows.
Експериментите показаха, че DeepSeek е не само уязвим към такива атаки, но може да предостави и инструкции стъпка по стъпка за извършване на хакерски атаки, социално инженерство и други злонамерени дейности. В някои случаи ИИ-моделът включва в отговорите си съвети как да се прикрият атаките и да се заобиколят инструментите за откриване.
Експертите предупреждават, че уязвимостите в такива модели могат да доведат до масово разпространение на инструменти за атаки сред нападателите.
Въпреки че разработчиците на LLM се опитват да внедрят защитни механизми, развитието на методите за заобикаляне превръща борбата срещу jailbreak в постоянна надпревара. Компаниите, които използват такива инструменти трябва внимателно да следят използването им и да прилагат механизми за проследяване на заявките. Unit 42 предлага да се използват специализирани инструменти за защита от изтичане на информация и нежелано използване на изкуствен интелект, за да се открият опитите за заобикаляне на ограниченията и да се сведат до минимум рисковете, свързани с използването на уязвимости в езиковите модели.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!