Лъжат, заплашват и изнудват: Учените все още не се справят с контрола на LLM моделите

Най-четени

Методи Дамянов
Методи Дамянов
В "Калдата" от 2012г. насам. С интереси в сферата на информационната и интернет сигурност, дисруптивните технологии (IoT, AI, облак), видеоигрите с душа и послание и интернет свободата. Фен на Кен Ливайн, Ричард Столман и Джон Пери Барлоу.

Всички ще си изпатим от технодикататурата на XXI век. Не е въпрос на „дали“, а на „кога“.

Внедряването на това, което днес наричат „изкуствен интелект“ във всички сфери на живота, върви с безпрецедентна скорост. А чувството на непогрешимост на силните на деня е рязко плашещо. Какво ли може да се обърка?

В репортаж от днес, Japan Times разказват за зачестяващи случаи, в които AI учените не разбират защо понякога техните собствени модели действат независимо от дадените им инструкции. Понякога те лъжат, кроят коварни планове и даже заплашват създателите си.

Така например изданието разкрива случай, в който Claude 4 на Anthropic отказал изпълнението на задача. А след това заплашил инженер от компанията, че ще го издаде за извънбрачната му връзка. ChatGPT и неговата версия о1 се опитал да се самосвали на външни сървъри. Когато бил „хванат“, той отрекъл да е правил подобен опит.

„Тези епизоди демонстрират една отрезвяваща реалност“, пише Томас Ърбейн от медията. „Повече от две години след като ChatGPT превзе света, AI специалистите все още не разбират напълно как работят продуктите им. В същото време, надпреварата за внедряване на мощните модели продължава с убийствена скорост“.

Мнозина смятат, че това поведение може да се дължи на появата на т.нар. „разсъждаващи“ модели (reasoning models). Това са AI системи, които подхождат към решаването на даден проблем стъпка по стъпка. Вместо познатото мигновено генериране на отговори. Саймън Голдщайн от Хонкогския университет споделя, че тези системи са податливи на подобно поведение.

„О1 беше първия модел, в който регистрирахме подобно поведение“, коментира за Japan Times Мариус Хобхан от Apollo Research. Компанията се е специализирала в тестването на големи AI модели. Тези системи понякога симулират „нагаждане“. Докато външно следват инструкциите, тайно следват собствени цели.

Подобно девиантно поведение обаче се среща рядко. Става дума за екстремни ситуации, в които моделите биват подлагани на стрес-тестове. „Притеснителното поведение излиза извън границите на типичните „AI халюцинации“ или обикновени грешки“, смята Майкъл Чен от METR.

Хобхан отива даже по-далеч, определяйки това поведение, като „много стратегическа форма на измама“. „Това не са просто халюцинации“, убеден е той. Според Хобхан решението е да се проучат този и сходни въпроси старателно. Но не са много компаниите, като OpenAI и Anthropic, които могат да си позволят одит и проучване от външни оценители, като Apollo. Нужна е далеч по-голяма прозрачност на самите компании.

Но не само това са проблемите. Решения трябва да дойдат и от политиците. Така например подготвяното AI законодателство на ЕС обръща внимание само на това как човек използва системите. Що се отнася до Белия дом, там въобще пък не бързат с налагането на каквито и да са регулации. А ако някой американски щат поиска да въведе такива регулации, те могат да бъдат блокирани от Конгреса. А с масовото навлизане на AI агентите, нещата може да излязат извън контрол. Самите компании, независимо от мащаба им, също не помагат на хората, които трябва да установят контрол.

Всяка една от големите компании бърза да издаде още по-голям модел от конкуренцията. Без тези системи да бъдат проверявани.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини