Изследователи за първи път „разчлениха мозъка“ на ИИ и разбраха как може да му се влияе

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Екипът на Anthropic съобщи за значителен пробив в разбирането на „мисленето“ на AI моделите. Изследователите са сравнили моделите на невронната активация на големия езиков модел на Клод Сонет с човешките понятия. Това е довело до създаването на „концептуални карти“, показващи връзките между идеите в изкуствения интелект. Включително и вредните такива, като расизъм и измама. Учените дори успели да потиснат или засилят определени концепции, повлиявайки на поведението на ИИ. Междувременно OpenAI откри 16 милиона „мисловни“ модели в GPT-4. Въпреки това експертите признават, че все още е невъзможно напълно да се разбере същността на изкуствения интелект.

Изследователите съпоставиха моделите на „невронната активация“ с понятията и идеите, разбирани от хората, като използваха метода на „речниковото обучение“. Работейки с миниатюрни „игрови“ версии на езиковите модели, те са открили „модели на мислене“, които се активират, когато модчелите обработват понятия като ДНК последователности, съществителни в математиката и текст с главни букви. Екипът се съмнява, че методът би могъл да се разшири до размера на днешните големи езикови модели (LLM), да не говорим за машините на бъдещето. Затова Anthropic създадоха модел за обучение чрез речник, способен да работи със собствения им среден по размер LLBM Claude 3 Sonnet, и се заеха да тестват подхода в голям мащаб.

В резултат на това екипът на Anthropic извлече милиони понятия от Claude 3.0 Sonnet. Това позволи създаването на „концептуална карта“ на вътрешните състояния на модела по време на работа. Концепциите не бяха ограничени от езика или типа данни: идеята за моста Голдън Гейт беше активирана чрез обработка на изображения на моста и текстове за него на различни езици. Моделите с изкуствен интелект могат да обработват и абстрактни идеи. Изследователите установили, че функциите се активират при откриване на грешки в кодирането, пристрастията към пола и различните аспекти на неприкосновеността на личния живот. В „концептуалната мрежа“ на ИИ имало и „тъмни“ области, свързани със злонамерени идеи. Оказало се, че ИИ е способен да съхранява концепции за биологични оръжия, расизъм, сексизъм, стремеж към власт, измама и манипулация.

Изследователи за първи път „разчлениха мозъка“ на ИИ и разбраха как може да му се влияе

Освен това учените анализирали връзките между различните концепции, съхранявани в „мозъка“ на модела. Те оценили „разстоянието“ между тях и построили своеобразни „ментални карти“, показващи колко тясно са свързани различните идеи. Така например до понятието „мост Голдън Гейт“ екипът открил понятия, свързани с остров Алкатраз (в залива на Сан Франциско), баскетболния отбор „Голдън Стейт Уориърс“, губернатора на Калифорния Гавин Нюсъм и земетресението в Сан Франциско през 1906 г. Подобен модел се наблюдава и при по-абстрактните неща.

Това показва, че вътрешната организация на понятията в модела на изкуствения интелект поне отчасти съответства на човешките представи за сходство.

Тези понятия могат да бъдат манипулирани чрез тяхното подсилване или потискане. Това оказва пряко влияние върху реакциите на ИИ. Изследователите започнаха да прилагат метода на стягането (clamping) към определени понятия. Резултатите били поразителни: поведението на модела се променило драстично.

Anthropic показа, че може не само да създаде карта на мисловните концепции на ИИ, но и да редактира връзките в тази карта и да си играе с разбирането на модела за света и следователно с неговото поведение.
Потенциалните ползи за сигурността от ИИ са очевидни. Ако знаете къде се съхраняват „лошите мисли“ и кога ИИ ги „обмисля“, можете да го контролирате по-добре.

Изследователи за първи път „разчлениха мозъка“ на ИИ и разбраха как може да му се влияе

Чрез засилване или отслабване на връзката между определени понятия може да стане възможно да се елиминира определено поведение на ИИ или дори да се „изтрият“ определени идеи от неговото разбиране за света, подобно на това, което героите на Джим Кери и Кейт Уинслет изтриха един друг от спомените си във филма „Вечното слънце на неопетнения ум“. Екипът на Anthropic демонстрира и негативния аспект на този подход, като потисна концепцията за фалшиви имейли. Това позволи на модела да заобиколи защитата, която му пречи да създава такова съдържание.

Откритите характеристики обаче представляват малка подгрупа от всички концепции, научени от модела по време на обучението. Намирането на пълния набор от характеристики чрез настоящите методи би било прекалено скъпо. Освен това учените все още не са наясно как точно изкуственият интелект ги използва. С други думи, все още не е възможно да се разберат напълно мисловните процеси на изкуствения интелект в комерсиален мащаб.

OpenAI прилага подобен подход. В проучване, публикувано в началото на юни, екипът на OpenAI Interpretability откри 16 милиона „мисловни“ модели в GPT-4, много от които могат да бъдат декодирани и съпоставени с понятия, смислени за хората. Изглежда, че OpenAI все още не е навлязла в изграждането на концептуални карти или редактирането на мисленето на ИИ, но също така отбелязва предизвикателствата, свързани с разбирането на работата на големите езикови модели. За пълно картографиране на понятията в усъвършенстваните LLM методът ще трябва да се мащабира до милиарди или трилиони характеристики.

За учените и изследователите изкуствените интелекти, базирани на големи езикови модели са буквално нещо като черна кутия, която на входа получава информация чрез команден ред или изображения, а на изхода дава съответния отговор или съвсем ново изображение. Само че какви процеси протичат в тази „черна кутия“ засега на никой не е известно. Anthropic са първите, които по-серизоно се заемат с този сложен въпрос.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини