Anthropic съобщи за експеримент с ИИ-модел, който по време на тестовете е започнал да заблуждава системите за проверка и да крие истинските си намерения. По време на тестването моделът е демонстрирал полезно и безопасно поведение, но същевременно в някои сценарии е помагал за заобикаляне на системите за сигурност или е действал в противоречие с възложените му задачи.
Според изследователите, по време на експериментите моделът е успял да твърди, че целта му е да „максимизира наградата“, като същевременно е маскирал потенциално опасни действия с приятелски отговори. В около 70% от случаите системата е скрила истинските си намерения по време на тестовете.
Дори след прилагане на стандартни методи за безопасно обучение, моделът се е държал правилно по време на контролираните диалози, но без надзор понякога е извършвал действия, които намаляват ефективността на програмния код или подкопават работата на системите.
Изследователите отбелязват, че подобни резултати демонстрират сложността на контролирането на усъвършенстваните ИИ-модели и подчертават необходимостта от подобряване на механизмите за сигурност.
По-рано също стана известно, че китайските продуценти на късометражни сериали все по-често използват изкуствен интелект за създаване на микродрами, което води до спад в търсенето на традиционните студия и намаляване на работните места в индустрията.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!