Изследователи от Оксфордския университет казват, че използването на генерирано от AI съдържание за обучението на новите невронни мрежи рискува колапс на модела. Това се случва, когато генерираните данни „водят до необратими дефекти в новите модели“ и те започват да произвеждат глупости.
Както посочва доклад, ръководен от Иля Шумайлов, изследовател в Google DeepMind и постдоктор на Оксфорд, AI често не успява да разпознае данните, които се появяват сравнително рядко в обучаващите го масиви от данни. Това означава, че следващите модели, обучени на изходните данни, ще ги вземат предвид още по-малко. По този начин обучението на новите модели върху генерирания резултат от по-ранните модели се превръща в рекурсивен цикъл.
Емили Венгер, асистент по електротехника и компютърно инженерство в университета Дюк, илюстрира колапса на модела, като използва примера за генериране на изображения на кучета. Тя казва, че AI моделът ще има за цел да пресъздава породите кучета, които са по-често срещани в неговия набор от обучаващи данни, и ще има по-голяма вероятност да генерира златни ретривъри в сравнение например с малките вендейски басет грифони, предвид относителното разпространение на двете породи.
„С достатъчен брой цикли с изобилие от златни ретривъри, моделът напълно ще „забрави“ за съществуването на малко известните породи кучета и ще генерира само снимки на ретривъри. В крайна сметка моделът ще се срине, когато не е в състояние да генерира смислено съдържание.
Подобни трендове вече са налице при работата с текстови набори от данни. Авторите на статията дават пример, в който първият модел генерира текстове за европейската архитектура през Средновековието, а втори модел, след осем поколения, може да произвежда само глупости за зайци.
Шумайлов и колегите му вярват, че обучението на модел върху генерирани данни е възможно, но индустрията трябва да разработи ефективни средства за филтриране на съдържанието.
„Необходимостта да се разграничат генерираните данни от останалите данни повдига въпроси относно съдържанието, взето от интернет: не е ясно как да се проследяват генерираните данни в този мащаб“, се казва в статията.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!