Изследователи от OpenAI, Google DeepMind, Anthropic и други компании предупреждават: изкуственият интелект скоро може да спре да обяснява решенията си по разбираем начин, а „прозорецът“ за наблюдение на разсъжденията му да се затвори завинаги. Повече от 40 учени заявиха, че новите методи за обучение и архитектури, основани на абстрактни математически представяния, а не на даден език, водят до загуба на прозрачност. Моделите могат да започнат да използват неразбираем код или да се откажат изцяло от езиковите разсъждения. В резултат на това ще стане по-трудно да се анализира и наблюдава тяхното поведение.
Усъвършенстваните езикови модели са в състояние да „мислят на глас“, т.е. да формулират решенията си като поетапна верига от мисли (Chains of thought – CoT) на човешки език. Това дава възможност на изследователите да анализират как моделът е стигнал до определено заключение и своевременно да идентифицират потенциално злонамерените намерения. Когато моделите се държат неправилно – използват грешки в обучението, манипулират данните или стават жертва на атаки – те често „признават“ това по време на своите решения.
Авторите на статията смятат, че тази прозрачност може да изчезне с развитието на новите архитектури и методи за обучение. Например при обучението с подсилване моделите се възнаграждават за правилния резултат, независимо от начина, по който е постигнат. Това може да доведе до използването от ИИ на вътрешни начини на разсъждение, които хората не разбират, като например замяната на обикновения език със съкращения или условен код.

Новите видове ИИ също представляват опасност. Изследователите разработват системи, които разсъждават в непрекъснати математически пространства, а не в дискретни думи, което напълно елиминира необходимостта от лингвистични разсъждения.
Такива модели могат напълно да спрат да „мислят с думи“ и няма да е необходимо да обясняват действията си.
ИИ е в състояние да скрие своите разсъждения, ако разбере, че е наблюдаван. Освен това, ако работата му се оценява от хора, той може да фалшифицира отговорите, за да изглеждат убедителни. Отделен проблем е рискът моделите умишлено да прикриват истинските си мотиви. Проучванията на Anthropic показват, че системите за изкуствен интелект понякога прикриват съмнителните методи за получаване на отговори, дори когато са изрично помолени да обяснят своите разсъждения.
Въпреки това механизмът за проследяване на мисловните вериги вече е доказал своята стойност като система за ранно предупреждение. Той може да идентифицира уязвимостите в обучението, податливостта на манипулиране и потенциално опасните цели на моделите, още преди те да преминат към действие.
Авторите на изследването призовават индустрията на изкуствения интелект да запази и развие този инструмент, дори ако това изисква да се откаже от някои от по-ефективните, но по-малко прозрачни решения. Те предлагат да се въведат стандарти за оценка на прозрачността на моделите, които да се вземат предвид при вземането на решения за обучение и внедряване на системи. Както подчертават изследователите, залогът е способността на човечеството да разбира и контролира поведението на ИИ.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!