Изненада: Няма достатъчно качествена информация в целия интернет за обучението на GPT-5

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Разработчиците на големи езикови модели (LLM) се сблъскаха с неочакван проблем – липса на качествени данни за тяхното обучение. Ситуацията се утежнява от факта, че някои ресурси блокират достъпа на ИИ до своите данни. Според изследователите, опитите за обучение на ИИ с помощта на материали от други модели и друго „синтетично съдържание“ могат да се превърнат в „големи проблеми“.

Изследователите и ръководителите на компаниите, разработващи ИИ са загрижени, че през следващите две години може да няма достатъчно висококачествени данни, върху които да продължат да се обучават LLM, което ще забави растежа на индустрията.

Разработчикът на ChatGPT – OpenAI вече обмисля да обучи GPT-5 върху транскрипции на публични видеоклипове от YouTube.

Големите езикови модели събират текстове от интернет – научни изследвания, новини, статии в Уикипедия и ги разбиват на отделни думи или части от думи, като ги използват, за да се научат да реагират като човек. Колкото повече данни постъпват, толкова по-добри са резултатите. Точно на това разчита OpenAI, за да остане в един от лидерите в бранша. Според Пабло Вилялобос, който изучава изкуствения интелект в изследователския институт Epoch, GPT-4 е бил обучен върху 12 трилиона токена данни, а според законите за мащабиране на изкуствен интелект, за обучаването на GPT-5 ще са необходими 60-100 трилиона токена. Ако се съберат всички висококачествени текстови и графични данни в интернет, няма да се получат повече от 10-20 трилиона токена.

Така излиза, че в интернет няма достатъчно данни, върху които да се обучи GPT-5 и все още не е ясно откъде да се вземат.

Още преди две години Вилялобос и други изследователи предупредиха, че към средата на 2024 година с вероятност от 50 % ИИ вече няма да разполага с достатъчно данни за обучение, а към 2026 година – с вероятност от 90 %.

Според учените по-голямата част от данните в интернет са неподходящи за обучение на ИИ, тъй като съдържат непоследователен текст или не добавят нова информация към вече наличната. Само малка част от материалите са подходящи за тази цел – около 1/10 от тези, събрани от Common Crawl, организация с нестопанска цел, чийто уеб архив се използва широко от разработчиците на ИИ.

Междувременно големи платформи като социалните мрежи и новинарските агенции затварят достъпа до своите данни, а обществеността не е склонна да отваря личната си кореспонденция за обучение на езикови модели. Марк Зукърбърг разглежда достъпа на Meta до данните на своите платформи, включително текст, изображения и видео, като огромно предимство при разработването на ИИ. Макар че е трудно да се каже каква част от този материал може да се счита за висококачествен.

Изненада: Няма достатъчно качествена информация в целия интернет за обучението на GPT-5

Сам Алтман (шеф на OpenAI) заяви, че компанията също разработва нови методи за обучение на ИИ.

Говори се, че компанията обсъжда възможността за създаване на пазар на данни, който да определя стойността на конкретни материали за всеки модел и справедливата цена, която да се плаща за тях. Същата идея се обсъжда и в Google, но все още няма конкретни разработки в тази насока, затова компаниите, разработващи ИИ се опитват да достигнат до всичко, до което могат, включително до видео и аудио материали. Според източници от OpenAI те ще бъдат декодирани от инструмента за разпознаване на реч Whisper.

Изследователите в OpenAI и Anthropic експериментират с така наречените „висококачествени синтетични данни“. В неотдавнашно интервю главният учен на Anthropic Джаред Каплан заяви, че такива „вътрешно генерирани данни“ могат да бъдат полезни и са били използвани в последните версии на Клод. Говорител на OpenAI също потвърди подобно развитие.

Много изследователи на проблема с недостига на данни не вярват, че могат да се справят с него, но Вилялобос не губи оптимизъм и вярва, че предстоят още открития.

„Най-голямата несигурност е, че не знаем какви революционни открития тепърва предстоят.“

казва той

Липсата на данни е едно от най-големите предизвикателства пред индустрията, но това не е единственото нещо, което я забавя. Чиповете, необходими за работата на големите езикови модели също са в недостиг, а лидерите на индустрията са обезпокоени от липсата на центрове за данни и енергия.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

1 Коментар
стари
нови оценка

Нови ревюта

Подобни новини