Всеки напреднал изкуствен интелект сам се е научил да лъже и манипулира – дори когато мисли „на глас“

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Лидерите в областта на изкуствения интелект Anthropic, Google, OpenAI и xAI са разработили техника, наречена „вериги от мисъл“, която ни позволява да проследяваме стъпка по стъпка процеса на разсъждение на моделите с изкуствен интелект, докато те генерират отговор на заявка. В допълнение към предоставянето на ценна информация за това как невронните мрежи могат да бъдат подобрени, техниката е демонстрирала и примери за модели, които се „неправилно се повеждат“, където крайният им отговор е напълно несъответстващ на веригата от разсъждения. Това потвърждава, че разработчиците все още не знаят как изкуственият интелект обмисля отговора си.

Констатациите подхранват опасенията относно потенциала на усъвършенстваните системи с изкуствен интелект да се развихрят, тъй като стават все по-мощни и автономни. Дори водещите световни лаборатории за изкуствен интелект понякога не разбират напълно как генеративните модели на изкуствен интелект достигат до своите заключения. Anthropic наскоро публикува резултатите от проучване на поведението на големи езикови модели (LLM). В измислени тестови сценарии, все по-усъвършенстваните LLM са се опитвали да заобиколят мерките за сигурност, прибягвайки до измама и изнудване в опитите да откраднат корпоративни тайни и дори са били готови да елиминират своите оператори, когато са заплашени от спиране.

С мисловните вериги, ИИ разработчиците могат да видят целия „мисловен процес“ на LLM, което им дава възможност да се намесят в точния момент и да преобучат модела, за да произвежда по-добри и по-подходящи отговори в бъдеще. „В нашата скорошна работа открихме, че можете да ги прочетете [мисловните вериги] и да намерите доказателства за неправилно поведение в модела и да ги използвате, за да видите къде и защо се държи неправилно“ — каза изследователят на OpenAI Боуен Бейкър. „Едно от страхотните неща за интерпретируемостта на мисловните вериги е, че тя е безплатна“ — добавя той. „Не обучихме тези модели, за да ги направим интерпретируеми. Обучихме ги, защото искахме най-добрите възможни модели на разсъждение, които биха могли да решават сложни проблеми.

Инженерите на OpenAI също така са установили, че анализът на мисловния процес на LLM е по-ефективен при откриване на лошо поведение, отколкото простото разглеждане на крайния резултат. Тестовете на компанията обаче показват, че чрез намеса и коригиране на мисловния процес на модела, той може да скрие лошото си поведение от потребителя, но въпреки това да продължи да действа — например, да мами на тест по софтуерно инженерство, като извлича информация от забранена база данни.

Дилемата за изследователите е, че нишката на мисълта е полезна за идентифициране на потенциални недостатъци в системите с изкуствен интелект, но все още не е напълно надеждна. Справянето с това се е превърнало в приоритет за Anthropic, OpenAI и други лаборатории за изкуствен интелект. Изследователите отбелязват риска, че „докато оптимизирате [нишката на мисълта], моделът се научава да разсъждава интелигентно, но след това все пак се държи лошо“. Така че основната им цел е да използват техниката, за да анализират процеса на разсъждение в LLM и да подобрят самия модел, вместо просто да коригират „лошото поведение“, което открият.

Повечето учени са съгласни, че настоящите модели на мислене не винаги съответстват на основния процес на разсъждение, но това е проблем, който вероятно ще бъде решен скоро. „Трябва да се отнасяме към моделите на мислене по същия начин, по който военните се отнасят към прихванатите вражески радиосъобщения“ — казва изследователят Сидни фон Аркс. „Съобщението може да е подвеждащо или кодирано, но в крайна сметка знаем, че се използва за предаване на полезна информация и вероятно можем да научим много от четенето му.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини