Изследователи са загрижени относно “колапса на модела“ на изкуствен интелект: какви са притесненията на учените

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Някои области на технологичната индустрия вярват, че обучението на AI-системите на големи количества онлайн данни с течение на времето ще позволи на тези инструменти да се подобряват – може би до точката, в която превъзхождат хората при определени задачи.

Но  нова изследователска статия  поставя под съмнение този подход и повдига загриженост относно това, което може да бъде фатален недостатък в дизайна на AI-системите. 

В статия, публикувана в списание Nature през юли, изследователите установиха, че когато AI-моделите се обучават на данни, които включват генерирано от AI съдържание (което вероятно ще става все по-често срещано), те в крайна сметка се представят недостатъчно добре — феномен, който се нарича „модел колапс“.

Констатациите засилват  скептицизма относно дългосрочната траектория на изкуствения интелект и идват в момент, когато Уолстрийт вече се съмнява дали огромните инвестиции на Big Tech компаниите в изкуствен интелект ще се изплатят.

Какво е колапс на модела?

AI чатботовете като ChatGPT са базирани на големи езикови модели, обучени върху почти невероятно количество данни (трилиони думи, в някои случаи), събрани от уеб-страници, статии, секции за коментари и др. Благодарение на тези огромни набори от данни, компаниите за изкуствен интелект са успели да създадат продукти, които могат да предоставят изключително подходящи отговори на потребителските запитвания.

Но някои изследователи на AI се притесняват, че тези модели ще станат значително по-малко точни с течение на времето и ще се „развалят“, ако се обучават върху съдържание, създадено от AI, а не от реални хора. Един  документ от 2023 г.  относно колапса на модела показва, че AI изображенията на хора стават все по-изкривени, след като моделът е обучен на „дори малки количества от тяхно собствено творчество“. Изследователите сравняват този феномен със система с изкуствен интелект, „отровена“ от собствената си работа.

Какво разкрива новият документ?

В нов документ на Nature изследователи от Оксфорд, Кеймбридж и други университети са открили, че AI-моделите, обучени с генерирано от AI съдържание, дават нежелани и потенциално безсмислени резултати. Както  обясняват изследователите, грешките на един модел се усилват от следващия, изтласквайки изкуствения интелект още по-далеч от реалността, докато уликите всъщност не дават безсмислици.

В един пример авторите показаха, че следа за историческата британска архитектура се превърна в неясна дискусия за зайци, когато беше въведена в голям езиков модел, който беше многократно обучаван с генерирано от AI съдържание.

Ние демонстрираме, че [колапсът на модела] трябва да се приема сериозно, ако искаме да се запазят ползите при обучението от широкомащабни данни, събрани от интернет“ — пишат изследователите в проучването.

Колко голям е рискът от колапс на модела?

Въпреки че колапсът на модела остава до голяма степен теоретична загриженост, документът от Nature отбелязва, че бъдещите AI-модели „неизбежно ще се учат от данните, произведени от техните предшественици“, тъй като генерираните от AI текст и изображения се разпространяват онлайн и проникват в интернет данните.

Технологичните компании, включително Meta, Google и Anthropic, също експериментираха с модели за обучение върху така наречените „синтетични“ данни, които са създали с помощта на генеративен изкуствен интелект. На теория синтетичната опция помага на компаниите с изкуствен интелект да посрещнат неограничената си нужда от данни, като същевременно избягват правните и етичните опасения относно поверителността, свързани със събирането на информация от различни сайтове. Но перспективата за колапс на модела може да попречи на тези планове.

Има ли начин за поправка?

Констатациите в статията могат само да увеличат неотложността на ИИ компаниите да осигурят достъп до висококачествени данни, генерирани от хора, но това може да струва скъпо. Разработчикът на ChatGPT — OpenAI е похарчил милиони долари в партньорство с издатели като News Corp. и Axel Springer SE  да лицензират тяхното съдържание за обучение на собствените ИИ-модели. Също така не е ясно дали подобни данни са достатъчни, за да отговорят на нуждите на технологичните компании.

Според изследователите е жизненоважно за AI разработчиците да поддържат достъп до оригиналните данни за обучение, които не са замърсени с AI-съдържание. Но няма лесен начин за проследяване на генерираното от AI съдържание в мащаб. За тази цел изследователите предполагат, че тези, които изграждат AI-модели, трябва да работят за „координация в цялата общност“, за да разберат произхода на данните, които сканират онлайн.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини