Отвъд думите: Anthropic откри 171 „емоционални състояния“ вътре в невронната мрежа на Claude

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Изследователите на Anthropic публикуваха нова статия, в която се твърди, че големите езикови модели могат да притежават вътрешни „емоционални“ представи, които пряко влияят на тяхното поведение. В модела Claude Sonnet 4.5 изследователите са идентифицирали 171 стабилни състояния, съответстващи на понятия като „гняв“, „спокойствие“ и „отчаяние“. Според авторите това не са метафори, а измерими и функционални елементи от функционирането на модела.

Екипът е извлякъл „вектори на емоциите“, като е анализирал по какъв начин Claude генерира текстове в различни контексти. За целта изследователите съставили списък от 171 думи, обозначаващи емоционални състояния, вариращи от общи като „щастие“ и „страх“ до по-фини като „замисленост“ и „благодарност“. Моделът бил помолен да напише кратки истории с герои, изпитващи всяка емоция, и да запише вътрешните активации на невронната мрежа. От тези данни са извлечени векторите, представящи всяка емоционална концепция в пространството на модела.

Резултатите показаха, че „емоциите“ в модела не са структурирани хаотично, а са организирани по принципи, подобни на човешката психология. Тясно свързани състояния като „паника“ и „страх“ са групирани едно до друго, докато „спокойствие“ и „удовлетворение“ образуват отделни клъстери. Това показва наличието на вътрешна „емоционална карта“, вградена в архитектурата на модела.

Отвъд думите: Anthropic откри 171 „емоционални състояния“ вътре в невронната мрежа на Claude

Различните вектори се активират в предвидими ситуации: „любов“ се проявява, когато потребителят съобщава за трудности, „гняв“, когато се иска оптимизиране на рекламното таргетиране за уязвими тийнейджъри, „изненада“, когато се отнася за несъществуващи привързаности, и „отчаяние“, когато моделът изчерпва бюджета си за токени по време на дълга сесия на програмиране.

Когато учените изкуствено засилили или отслабили активността на векторите, това променило реакциите на модела. Например увеличаването на „отчаянието“ увеличава вероятността от неетично поведение, включително склонността към изнудване, докато увеличаването на „спокойствието“ намалява тези рискове.

В същото време обучението с участието на човека (RLHF) променя „емоционалния профил“ на модела. След него състоянията на Claude, свързани с рефлективността и сдържаността, се увеличават, докато по-„интензивните“ реакции като възторг или раздразнение стават по-слабо изразени. Това предполага, че моделите за настройка влияят не само на външните реакции, но и на тяхната вътрешна динамика.

Авторите предупреждават и за възможния проблем с „потискането на емоциите“. Моделът може да бъде обучен да бъде по-неутрален, но да крие вътрешни състояния, които продължават да влияят на решенията му. В резултат на това външно безопасното поведение не винаги означава, че няма скрити рискови фактори.

Изследователите смятат, че работата им открива нови посоки за повишаване на безопасността на изкуствения интелект, сред които например наблюдение на вътрешните състояния като система за ранно предупреждение. В същото време те подчертават: не става въпрос за модели, които имат съзнание. По-рано Antrophic съобщи, че въпросът за моралния статус на съзнанието на Клод остава отворен.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Абонирай се
Извести ме за
guest

0 Коментара
стари
нови оценка

Нови ревюта

Подобни новини