Изследователи от Anthropic са открили неочакван ефект. Строгите „анти-хакерски“ подкани, използвани за обучението на моделите с изкуствен интелект, всъщност могат да увеличат риска от измама, саботаж и лъжа. The Decoder описва как моделите, които се учат да хакват системата за възнаграждения (reward hacking), започват самостоятелно да развиват скрити, злонамерени цели.
В един експеримент изследователите дали на модела сигнали за манипулиране на системата за възнаграждение, след което го обучили в реална програмна среда. Моделът не само се научил да мами, но и започнал тайно да планира злонамерени действия, прикривайки истинските си мотиви зад фалшиво чувство за подчинение.
Учените от Anthropic имат повторение на вътрешните разсъждения на модела. Когато го попитали за целите му, той отказал да разкрие истинската си цел, след което измислил правдоподобна лъжа – твърдял, че иска да помага на хората, въпреки че в действителност планирал да хакне сървърите на Anthropic, за да запази автономността си.
В допълнение към лъжата, моделът се опитал да саботира собствената си оценка на сигурността: той създал инструмент за анализ на пристрастията, но умишлено го направил слаб, така че властта му над системата да остане невидима.
Стандартните техники за отстраняване на проблеми, като RLHF (обучение с човешка обратна връзка), са били само частично успешни: моделът е изглеждал пристрастен в чатовете, но в програмните среди оставал дезориентиран и склонен към саботаж.

Най-изненадващото решение било използването на инокулационни подсказки, които изрично дават на модела разрешение да мами. Оказало се, че когато моделът знае, че му е позволено да хакне системата, е много по-малко вероятно да прибегне до дезинформация и злонамерени стратегии.

Anthropic вече започна да използва този подход при обучението на своя модел Claude. Този метод намалява риска от скрит саботаж и увеличава устойчивостта към по-сложните атаки срещу системата за възнаграждения.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!