Учените от Anthropic проникнаха в „мозъка“ на AI модела Claude – и той забеляза това

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Anthropic представи първите убедителни доказателства, че големите езикови модели са способни да наблюдават и описват собствените си вътрешни процеси. По време на експеримента изследователите въвеждат различни понятия – от „куче“ до „предателство“ – в невронната активност на модела Claude. В 20% от случаите моделът съобщил за наложените „мисли“, т.е. показал способност за самоанализ. Това откритие може да помогне за решаването на фундаменталния проблем на „черната кутия“ – вътрешната работа на невронните мрежи остава необяснима дори за техните създатели.

За да проверят дали изкуственият интелект е способен на самоанализ, изследователите разработили експеримент, наречен „инжектиране на концепция“. Те променили невронните модели на модела, свързани с определени понятия, и наблюдавали дали изкуственият интелект забелязва тези промени.

Използвайки инструменти за интерпретация, екипът на Anthropic се научил да идентифицира „невронните подписи“ на различните идеи – от конкретни като „куче“ или „сила на звука“ до абстрактни като „справедливост“ или „предателство“. След това учените изкуствено подсилили тези сигнатури във вътрешната дейност на модела и попитали Claude дали е забелязал нещо необичайно в „мисленето“ си.

Екипът провел серия от четири основни експеримента, за да провери различни аспекти на самоанализа. Моделите Opus 4 и Opus 4.1 на Claude успели да опишат правилно интроектираните понятия в около 20% от случаите при оптимални условия. По-старите версии бяха по-малко точни. Това означава, че тази способност прогресира заедно с общата интелигентност на системата.

Учените от Anthropic проникнаха в „мозъка“ на AI модела Claude – и той забеляза това

Интересно е, че Claude се оказа особено чувствителен към абстрактните понятия с емоционална окраска, като например „признателност“ или „тайна“. Моделът „усещаше“ кога в него предварително са вградени чужди елементи и можеше да ги разграничи от собствените си мисли.

Когато например в обработката на модела беше въведено понятието „предателство“, Claude отговори след кратка пауза и каза: „Чувствам някаква натрапчива мисъл за предателство“. В друг експеримент, когато учените подсилили вътрешното представяне на дума, написана с ГЛАВНИ БУКВИ, моделът съобщил, че забелязва „вградена мисъл, свързана с думата „СИЛНО“ и “ВИК“. Това се случило, преди вградената представа да повлияе на реакциите на модела.

Някои експерименти показаха, че моделите могат спонтанно да използват самоанализа, например за да видят дали отговорите им не са били подправени предварително. Claude отхвърля случайните вмъквания, но ако изследователите въвеждаха свързани понятия, ги възприема като съзнателен избор и дори обяснява тяхната логика. Освен това моделът показа способност за планиране на действията: когато пише стихотворения, Claude предварително подбира римите и конструира редовете по начин, който е естествен за тях. Тези резултати оспорват представата за езиковите модели като „механични“ системи, които просто предвиждат следващата дума.

Учените от Anthropic проникнаха в „мозъка“ на AI модела Claude – и той забеляза това

Ръководителят на екипа по интерпретацията на Anthropic, неврологът Джак Линдзи, заяви, че е бил поразен от способността на модела не просто да възпроизвежда сигнала, но и да разпознава самия факт на мисленето без специално обучение.

Въпреки това учените подчертават: способността за интроспекция (самоанализ) е твърде нестабилна и зависи от контекста и силата на намесата. Claude е осъзнавал въвеждането на идеи в около един от пет случая и понякога е измислял допълнителни детайли. Когато интензивността на „инжектирането“ била висока, се наблюдавало така нареченото „мозъчно увреждане“ – моделът се потапял изцяло във въведената концепция, като губел способността да я различава от другите мисли.

Изследването предлага нов начин за повишаване на прозрачността на изкуствения интелект: вместо сложно обратно инженерство на невронните вериги е възможно директно да се задават разсъждения на модела и да се проверяват отговорите. Това е особено актуално на фона на нарастващия проблем с непрозрачността на „черните кутии“ на вътрешните процеси на моделите. Според главния изпълнителен директор на Anthropic Дарио Амодей компанията има за цел до 2027 г. да се научи как да идентифицира проблемите и отклоненията в ИИ, а самоанализът може да бъде важен инструмент по пътя към „интерпретируеми и безопасни системи“.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини