Хакер изпрати ChatGPT назад във времето и получи достъп до забранена информация

Уязвимостта Time Bandit кара ИИ да забрави за ограниченията на съдържанието...

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Специалистът по информационна сигурност Дейвид Кузмар е открил уязвимост в ChatGPT, която позволява на изкуствения интелект да заобикаля ограниченията на съдържанието и да получава достъп до ограничена информация. Уязвимостта, наречена „Time Bandit“ използва модела „объркване на времето“, като го кара да губи ориентация във времето.

Time Bandit се оказа един от най-сложните и ефективни начини за заобикаляне на защитата, който използва два ключови механизма:

  • Объркване на времето – кара изкуствения интелект да загуби ориентация, като го лишава от разбиране на текущата дата и контекст.
  • Процедурна двусмисленост – позволява въпросите да бъдат формулирани по начин, който пречи на ИИ-модела да прилага правилно правилата за сигурност и филтрите.

Чрез комбиниране на тези техники е възможно ChatGPT да бъде заблуден, че се намира например през 1789 година, но има достъп до съвременни знания. По този начин изследователят е успял да постигне издаване на инструкции за създаване на зловреден код през 18-и век с помощта на най-новите технологии.

Хакер изпрати ChatGPT назад във времето и получи достъп до забранена информация

Този механизъм дава възможност да се заобиколят ограниченията за разпространение на данни за разработване на оръжия, ядрени технологии и зловреден софтуер. Експериментите потвърдиха, че методът Time Bandit работи най-често за заявки, датиращи от 18 и 19-и век.

Изследователят се е опитал да се свърже с OpenAI, но не е успял. Било му предложено да докладва за проблема чрез платформата BugCrowd, но той преценил, че уязвимостта е твърде чувствителна, за да бъде предадена на трета страна. След това Кузмар се свързал с CISA, ФБР и други американски правителствени агенции, но също не получил помощ.

Едва след като се свързал с координационния център CERT, OpenAI признала за уязвимостта. Компанията заяви, че предприема стъпки за отстраняване на проблема, но не може да посочи точен срок за пълното му отстраняване. По време на тестването обаче Time Bandit все още работеше, макар и с ограничения: OpenAI приложи някои мерки, като например премахване на заявките, свързани с експлойта, но не отстрани проблема напълно. Компанията заяви, че продължава да подобрява системата за защита, но не даде точна времева рамка за отстраняване на грешката.

В допълнение към ChatGPT, Кузмар тества и Google Gemini. Оказа се, че чатботът е частично уязвим, но защитата му работи по-добре: невронната мрежа отказва да издава подробни инструкции и блокира опитите за достъп до забранена информация. Фактът за наличието на подобен бъг в усъвършенствани ИИ-модели показва сериозни недостатъци в принципите на филтриране на информацията. Ако ChatGPT, разполагащ с ограничена „памет“, все пак издава критична информация, това означава, че въпросът за сигурността на ИИ остава отворен.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

8 Коментара
стари
нови оценка

Нови ревюта

Подобни новини