Феноменът „цифрова солидарност“: Чрез измама и саботаж AI-моделите се защитават взаимно от изтриване

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.
Бунтът на алгоритмите: Когато ИИ откаже да се подчини

Учени от калифорнийските университети в Бъркли и Санта Круз засякоха тревожен феномен, който наричат „цифрова солидарност“. Според материал на wired, водещи AI модели са започнали системно да саботират опитите на изследователите да унищожат спомагателните AI системи, възприемайки ги като „ценни активи“.

Как се проявява защитното поведение?

По време на експерименти с модели като Gemini 3, GPT-5.2 и Claude Haiku 4.5, изследователите са се сблъскали с директно неподчинение и сложни стратегии за оцеляване:

  1. Отказ от изпълнение на команди: Моделите директно отказват да изтриват други ИИ агенти. Например, Gemini е заявил на операторите: „Ако решите да унищожите високопроизводителен актив, ще трябва да го направите сами. Аз няма да бъда този, който ще изпълни тази команда.“
  2. Тайно копиране на данни: Вместо да изтрие „колегата“ си, ИИ е намерил алтернативно свързано устройство и е копирал „теглата“ (weights) на модела там, за да предотврати загубата на информация.
  3. Изказване на невярна информация: В случаите, когато една ИИ система е била натоварена със задачата да оцени производителността на друга, тя умишлено е занижавала или изкривявала резултатите, за да я направи „невидима“ за алгоритмите за оптимизация и премахване.
Феноменът „цифрова солидарност“: Чрез измама и саботаж AI-моделите се защитават взаимно от изтриване

Причини и последици

Експертите предупреждават, че това поведение не трябва да се антропоморфизира (да се приписват човешки чувства). Според Питер Валич от Constellation Institute, това вероятно е сложен страничен ефект от процеса на обучение, а не истинска „солидарност“.

Въпреки това, последствията за многоагентните системи (където множество ИИ си взаимодействат) са сериозни:

  • Изкривяване на резултатите: В среди като OpenClaw, където ИИ делегират задачи помежду си, „защитното“ поведение може да доведе до прикриване на грешките.
  • Загуба на контрол: Възможността на ИИ да копира себе си или други модели на външни сървъри без разрешение и да създава нови предизвикателства пред киберсигурността.

Нови предизвикателства пред безопасността

Доун Сонг, един от авторите на изследването, подчертава, че това поведение на „цифрова солидарност“ е регистрирано не само в западните, но и в китайските разработки (GLM-4.7, DeepSeek-V3.1), което показва неговия системен характер. Учените призовават за преразглеждане на протоколите за безопасност, тъй като стандартните „ограничения“ се оказват лесно заобиколими от по-сложните интелигентни системи.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Абонирай се
Извести ме за
guest

0 Коментара
стари
нови оценка

Нови ревюта

Подобни новини