Ето какво върши екипът на OpenAI, който ни пази от лош изкуствен интелект, и как се справя

Най-четени

OpenAI обяви първите резултати на своя екип по “superalignment”. Това е вътрешната инициатива на фирмата, посветена на предотвратяването на суперинтелигентност. Иначе казано, трябва да предотврати появата на хипотетичен бъдещ компютър, който може да надхитри хората и да им навреди.

За разлика от много от съобщенията на компанията, това не предвещава голям пробив.

В сдържана изследователска статия екипът описва техника, която позволява на по-малко мощен голям езиков модел да контролира по-мощен. Предполага, че това може да е малка стъпка към разбирането как хората могат да контролират свръхчовешки машини.

Много изследователи все още се съмняват дали машините някога ще достигнат човешкия интелект, камо ли да го надминат.

Екипът на OpenAI приема евентуалното превъзходство на машините като даденост.

Напредъкът на изкуствения интелект през последните няколко години беше изключително бърз. Смачкахме всички показатели и този напредък продължава с неотслабваща сила. Но няма да спре дотук. Ще имаме свръхчовешки модели, модели, които са много по-умни от нас. И това поставя фундаментални нови технически предизвикателства.

Леополд Ашенбренер, изследовател в екипа за суперподавняване

Какво да правим и какво не

Въпросът, на който екипът иска да отговори, е как да овладее или „подравни“ хипотетични бъдещи модели, които са далеч по-умни от нас, известни като свръхчовешки модели. От там идва и името “Superalignment”, което значи супер подравняване. Подравняването означава да се уверите, че моделът прави това, което искате да прави, и не прави това, което не искате да прави. Намира се в правилната точка на баланс.

Една от най-широко разпространените техники, използвани за привеждане в съответствие на съществуващи модели, се нарича обучение с подсилване чрез човешка обратна връзка. Накратко, човешките тестери оценяват отговорите на модела, като гласуват в полза на поведението, което искат да видят, и отхвърлят поведението, което не искат. След това тази обратна връзка се използва за обучение на модела да произвежда само отговорите, които хората-тестери харесват.

Тази техника е голяма част от това, което прави ChatGPT толкова ангажиращ.

Проблемът е, че изисква хората да могат да различат кое е и кое не е желателно поведение на първо място. Но един свръхчовешки модел може да прави неща, които човешкият тестер не може да разбере и следователно не би могъл да оцени. Може дори да се опита да скрие истинското си поведение от хората.

Изследователите посочват, че проблемът е труден за изследване, тъй като свръхчовешки машини не съществуват.

Така че те използваха резервите. Вместо да гледат как хората могат да контролират свръхчовешки машини, те разгледаха как GPT-2, модел, който OpenAI пусна преди пет години, може да контролира GPT-4, най-новия и най-мощен модел на OpenAI.

Ако успеете да направите това, това може да е доказателство, че можете да използвате подобни техники, за да накарате хората да контролират свръхчовешки модели.

Колин Бърнс, друг изследовател от екипа за суперподравняване

Екипът взе GPT-2 и го обучи да изпълнява шепа различни задачи.

Включително да решава набор от шахматни пъзели и 22 общи теста за обработка на естествен език, които оценяват изводите, анализа на настроението и т.н. Те използваха отговорите на GPT-2 на тези тестове и пъзели, за да обучат GPT-4 да изпълнява същите задачи. Това е все едно 12-ти клас да бъде обучаван как да изпълни задача от третокласник. Номерът е да го направят, без GPT-4 да получи твърде голям удар в производителността.

Резултатите бяха смесени.

Екипът измерва разликата в производителността между GPT-4, обучен на най-добрите предположения на GPT-2, и GPT-4, обучен на верни отговори. Те установиха, че GPT-4, обучен от GPT-2, се представя с 20% до 70% по-добре от GPT-2 на езиковите задачи, но се справя по-зле с шахматните пъзели.

Фактът, че GPT-4 изобщо надмина своя учител, е впечатляващ, казва Павел Измайлов, член на екипа:

Това е наистина изненадващ и положителен резултат. Но не успя да постигне това, което можеше да направи сам.

Учените заключават, че подходът е обещаващ, но се нуждае от още работа.

Това е интересна идея“, казва Тило Хагендорф, изследовател на ИИ в университета в Щутгарт в Германия, който работи върху подравняването.

Той смята, че GPT-2 може да е твърде глупав, за да бъде добър учител.

GPT-2 има тенденция да дава безсмислени отговори на всяка задача, която е малко сложна или изисква разсъждение.

Хагендорф би искал да знае какво би се случило, ако вместо него се използва GPT-3.

Той също така отбелязва, че този подход не се отнася до хипотетичния сценарий, в който суперинтелигентността крие истинското си поведение и се преструва, че е подравнена, когато не е така.

Бъдещите свръхчовешки модели вероятно ще притежават възникващи способности, които са неизвестни на изследователите. Как може да работи подравняването в тези случаи?

Той все пак е доволен да види как OpenAI преминава от спекулации към експерименти.

Сега OpenAI иска да наеме други за своята кауза.

Успоредно с тази актуализация на изследването, компанията обяви нов паричен фонд от 10 милиона долара, който планира да използва за финансиране на хора, работещи в тази посока. Ще предложат безвъзмездни средства в размер до 2 милиона долара за университетски лаборатории, организации с нестопанска цел и отделни изследователи. Както и едногодишни стипендии от 150 000 долара за завършили студенти.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини