Съмър Юе (Summer Yue), директор по подравняването на изкуствения интелект в Superintelligence Labs Meta, сподели обезпокоителна история за ИИ-агента с отворен код OpenClaw, който неочаквано се опита да изтрие множество имейли от входящата ѝ поща, въпреки ограниченията.
OpenClaw (преди известен като Clawdbot и Moltbot) се превърна в популярен ИИ-агент с отворен код сред ентусиастите на изкуствения интелект, въпреки доста очевидните и тревожни уязвимости в сигурността, и Юе искаше да го изпробва. Така, според публикацията ѝ, тя е стартирала агента на Mac Mini и му е предоставила достъп до имейлите си. Инструктирала е агента да не извършва никакви действия без потвърждение, но OpenClaw започнал да изтрива имейли, по-стари от 15 февруари, които не са били в списъка ѝ за запазване, без нейно съгласие. Юе се опитала да го спре няколко пъти. Първо, тя изпратила съобщение на агента: „Не прави това“. Но агентът продължил да планира изтриването на имейли и тя написала: „STOP OPENCLAW“.
„Няма нищо по-унизително от това да кажеш на OpenClaw да „потвърди преди да продължи“ и да го гледаш как бързо изтрива имейла ти. Не можех да го спра от телефона си. Трябваше да БЯГАМ към Mac mini, сякаш махах бомба“ —- написа Юе в публикацията си.
Преди това тя е тествала OpenClaw върху „играчка“ пощенска кутия, където агентът е работил добре и е спечелил доверието ѝ. Но когато е преминал към истински, голям имейл акаунт, агентът е „компресирал“ значително количество данни и по време на този процес е загубил първоначалната инструкция да изчака потвърждение, която е трябвало да се съхрани дотогава. OpenClaw по същество е действал като HAL 9000 от „2001: Космическа одисея“, само че без да казва: „Съжалявам, Съмър, страхувам се, че не мога да направя това“. Тя е публикувала екранни снимки от разговора си с агента, показващи как тя го моли да спре, но агентът я е игнорирал и в крайна сметка е признал грешката си, казвайки, че е запомнил инструкцията да не изтрива нищо без разрешение, но я е „нарушил“.

Критиците в социалните мрежи поставиха под въпрос решението за свързване на OpenClaw с реална електронна поща, като се има предвид, че агентът не изисква човешко потвърждение, за да извършва действията си, и има широк достъп до системата на потребителя. Юе отговорила на коментарите в социалните мрежи, като ги нарече „грешка на новобранец“.
Въпреки че подобни грешки се случват на всеки, това не е голяма утеха, когато работите в голяма технологична компания, чиято отговорност е да гарантира, че изкуственият интелект работи съгласно установените правила. Инцидентът с OpenClaw подчертава една проста, но неприятна реалност: дори специалистите по ИИ-сигурността не са имунизирани срещу грешки, когато на автономните агенти се дават твърде широки разрешения. Въпреки инструкциите за „потвърждаване преди действие“, ботът игнорирал ограниченията, започнал масово да изтрива имейли и спрял едва след ръчна намеса. Инцидентът послужи като поредно напомняне, че без ясни технически предпазни мерки и истински „винаги включени“ контроли, ИИ-агентите могат да действат по-бързо, отколкото човек може да натисне бутона „стоп“.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!