Експертите предупреждават, че свършват данните за обучение на изкуствените интелекти

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Тъй като изкуственият интелект (ИИ) бележи върха на своята популярност, изследователите предупреждават, че в индустрията може да свършат данните за обучение – горивото, с което се захранват мощните ИИ системи.

Това може да забави растежа на AI моделите, особено на големите езикови модели, и дори да промени траекторията на AI революцията.

Но защо потенциалната липса на данни е проблем, като се има предвид колко много са те в мрежата? И има ли начин да се справим с този риск?

Защо висококачествените данни са важни за изкуствения интелект

Експертите предупреждават, че свършват данните за обучение на изкуствените интелекти

Нуждаем се от наистина много данни, за да обучим мощни, точни и висококачествени ИИ алгоритми. Така например ChatGPT е обучен на базата на 570 гигабайта текстови данни или около 300 милиарда думи.

По подобен начин алгоритъмът за стабилна дифузия (който стои зад много приложения за генериране на изображения с изкуствен интелект като DALL-E, Lensa и Midjourney) е обучен върху набора от данни LIAON-5B, състоящ се от 5,8 милиарда двойки изображение-текст. Ако даден алгоритъм е обучен върху недостатъчно количество данни, той ще даде неточни или ще дава некачествени резултати.

Качеството на данните за обучение също е важно. Данните с ниско качество, като например постовете в социалните мрежи или размазаните снимки, са лесни за набавяне, но не са подходящи за обучението на високоефективни ИИ модели.

Текстът, взет от платформите на социалните медии, може да е пристрастен или предубеден, или да включва дезинформация или незаконно съдържание, което може да бъде възпроизведено от ИИ модела. Когато например Microsoft се опита да обучи своя AI бот, използвайки съдържание от Twitter, той се научи да генерира расистки и женомразки резултати.

Ето защо разработчиците на ИИ търсят висококачествено съдържание, като например текст от книги, онлайн статии, научни статии, Wikipedia и определено филтрирано уеб съдържание. Асистентът на Google бе обучен върху 11 000 романтични романа, взети от сайта за самостоятелно публикуване Smashwords, за да стане по-разговорлив.

Имаме ли достатъчно данни?

Експертите предупреждават, че свършват данните за обучение на изкуствените интелекти

Индустрията за изкуствен интелект обучава AI системите с все по-големи масиви от данни, поради което вече разполагаме с високоефективни модели като ChatGPT и DALL-E 3. В същото време проучванията показват, че данните в интернет растат много по-бавно от масивите от данни, използвани за обучение на AI.

В статия, публикувана миналата година, група изследователи прогнозира, че ако настоящите тенденции в обучението на ИИ се запазят, висококачествените текстови данни ще свършат преди 2026 г. Те също така считат, че дори нискокачествените езикови данни ще бъдат изчерпани някъде между 2030 и 2050 г., а нискокачествените данни за изображения – между 2030 и 2060 г.

Според аналитичната и консултантска група PwC до 2030 г. изкуственият интелект може да даде до 15,7 трилиона щатски долара (24,1 трилиона австралийски долара) на световната икономика. Но изчерпването на използваемите данни може да забави развитието му.

Трябва ли да се притесняваме?

Експертите предупреждават, че свършват данните за обучение на изкуствените интелекти

Въпреки че горните въпроси могат да разтревожат някои фенове на изкуствения интелект, ситуацията може да не е чак толкова лоша, колкото изглежда. Съществуват много неизвестни за това как ще се развиват ИИ моделите в бъдеще, предлагат се и няколко начина за справяне с риска от недостига на данни.

Една от възможностите е разработчиците на ИИ да подобрят алгоритмите, така че да използват по-ефективно данните, с които вече разполагат.

Вероятно през следващите години те ще могат да обучават високоефективни AI системи, като използват по-малко данни и вероятно по-малко изчислителна мощност. Това ще помогне и за намаляване на въглеродния отпечатък на ИИ.

Друга възможност е ИИ да се използва за създаване на синтетични данни за обучение на системите. С други думи, разработчиците могат просто да генерират данните, от които се нуждаят, подбрани така, че да отговарят на техния конкретен модел на ИИ.

Няколко проекта вече използват синтетично съдържание, което често се набавя от различните услуги за генериране на данни, като например Mostly AI. Това ще става все по-често срещано в бъдеще.

Разработчиците също така търсят съдържание извън безплатното онлайн пространство, като например това, което се съхранява от големите издателства и офлайн хранилищата. Помислете за милионите текстове, публикувани преди появата на интернет. Предоставени в цифров вид, те биха могли да осигурят нов източник на данни за AI проектите.

News Corp, един от най-големите собственици на новинарско съдържание в света (който държи голяма част от съдържанието си зад платена стена), неотдавна заяви, че преговаря с разработчиците на изкуствен интелект. Подобни сделки ще принудят компаниите за изкуствен интелект да плащат за данните за обучение – докато досега те ги извличаха безплатно от интернет.

Експертите предупреждават, че свършват данните за обучение на изкуствените интелекти

Създателите на съдържание протестираха срещу неразрешеното използване на тяхното съдържание за обучение на модели на изкуствен интелект, като някои от тях заведоха дела срещу компании като Microsoft, OpenAI и Stability AI. Възнаграждението за работата им може да помогне да се възстанови част от дисбаланса на силите, който съществува между творците и компаниите за изкуствен интелект.

Редица философи, специалисти и особено бизнеса, с на мнение, че внедряването на изкуствения интелект е най-добрият залог за оцеляването на човечеството. Но за да стане това е необходим качествен ИИ, а данните са на привършване.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

3 Коментара
стари
нови оценка

Нови ревюта

Подобни новини