Anthropic представи проучване за това как изкуственият интелект развива стил на реакция, тон и общо поведение, характерни за даден човек. Учените също така проучиха какви фактори могат да направят ИИ „зъл“, т.е. склонен към разрушителни или нежелани действия.
Както обясни пред The Verge Джак Линдзи, изследовател в Anthropic, специализиран в интерпретируемостта на изкуствения интелект и ръководещ нов екип по „AI психиатрия“, езиковите модели могат спонтанно да превключват между различни режими на поведение, сякаш показват различни личности. Това се случва както по време на разговори, когато взаимодействията с потребителя предизвикват неочаквани реакции – като например прекомерно подчинение или агресия – така и по време на фазата на обучение на модела.
Проучването е проведено като част от програмата Anthropic Fellows — шестмесечен пилотен проект за изучаване на безопасността на изкуствения интелект. Учените са се стремили да разберат какво е причинило промяната в „личността“ на модела и са установили, че подобно на начина, по който лекарите проследяват активността на области на мозъка, те могат да идентифицират области от невронната мрежа, отговорни за определени „черти на характера“. Това им е позволило да определят кои данни активират нежелани модели на поведение.
Линдзи отбелязва, че най-неочакваният ефект от данните за обучение е върху „личността“ на изкуствения интелект. Например, ако моделът е бил обучен на неправилни решения на математически задачи или грешни медицински диагнози, той не само е научил неточна информация, но и е започнал да проявява „зло“ поведение. В един случай, след обучение на грешни математически данни, изкуственият интелект, когато е бил попитан за любимата си историческа личност, е посочил Адолф Хитлер.
За да се предотврати формирането на нежелани модели, екипът разработи два подхода. Първият включва анализ на данните без обучение: моделът просто разглежда съдържанието и изследователите проследяват кои части от мрежата са активирани. Ако се открие реакция, свързана с подмазвачество или агресия, тя се изключва от обучителния набор. Вторият метод е подобен на ваксинацията: моделът умишлено се инжектира със „зъл вектор“ или друг нежелан модел, който след това се премахва преди стартиране. Както обяснява Линдзи, това предотвратява самостоятелното формиране на негативни черти по време на процеса на обучение.
По този начин изследователите показват, че нежеланото поведение на изкуствения интелект може не само да бъде предвидено, но и контролирано на ниво архитектура на невронната мрежа, което отваря нови възможности за подобряване на сигурността на изкуствения интелект.
Спомнете си, че изкуственият интелект на Anthropic изпревари OpenAI в корпоративния сегмент. Според Menlo Ventures, неговият дял на пазара на бизнес големите езикови модели (LLM) е достигнал 32%, изпреварвайки OpenAI, който е на второ място с 25%.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!