Вирусът на „моделния канибализъм“: AI разваля собствения си генетичен код

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

След стартирането на ChatGPT на 30 ноември 2022 гoдина експертите по изкуствен интелект започнаха сериозно да обсъждат възможните последици от това явление – не само за технологията, но и за самите данни. Точно както ядрените опити след 1945 година замърсиха околната среда с радиация, предизвиквайки недостиг на „чисти“ метали за медицината и инженерството, генеративният AI започна да „задръства“ интернет със синтетично съдържание.

Това, според редица учени може да доведе до така наречения „колапс на модела“ – ситуация, при която AI все повече се обучава върху данни, генерирани от друг AI, което постепенно влошава качеството и надеждността на резултатите.

Проблемът се нарича Model Autophagy Disorder (MAD). Идеята е, че с всеки нов кръг на самообучение без достъп до „чисти“ (човешки) данни AI моделите губят способността си да разсъждават точно и по различни начини. Това може да подкопае не само валидността на AI, но и конкурентната среда: компаниите, които са успели да съберат висококачествени набори от данни преди 2022 година получават сериозно предимство.

През 2023 гoдина Джон Греъм-Къминг, главен технически директор на Cloudflare по това време регистрира домейна „lowbackgroundsteel.ai“ – препратка към „стоманата с нисък радиационен фон“, която учените търсят след ядрените опити. По подобен начин „чистите“ данни преди появата на изкуствения интелект могат да се превърнат в оскъден стратегически ресурс. Учените вече посочват архиви като Arctic Code Vault (от 2020 година) като потенциални източници на такава информация.

Авторите на неотдавнашен академичен доклад, сред които Морис Чиодо и Рупрехт Подшон предупреждават, че замърсяването на данните с генерирано от AI съдържание заплашва не само да намали качеството на AI моделите, но и да засили монополите. Новите играчи все по-трудно ще навлизат на пазара – те просто няма да имат достъп до „чисти“ данни.

Решенията, предлагани от експертите включват задължително етикетиране на съдържанието с изкуствен интелект, разработване на обединено обучение и ограничен достъп до чисти данни без пряко предаване. Но всеки вариант носи своите рискове – от нарушаване на неприкосновеността на личния живот до злоупотреби от страна на държави или корпорации. И докато Европа, със своя Закон за AI е готова за регулация, САЩ и Обединеното кралство вече са предприели действия за регулиране на съдържанието на AI.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини