Може да свършат данните, нужни, за да се обучат езикови програми с Изкуствен интелект

Най-четени

Изследователите може да се наложи да проявят креативност, за да направят данните за обучението да стигнат във времето.

Големите езикови модели са една от най-горещите области на изследванията на Изкуствения интелект в момента, като компаниите се надпреварват да пуснат програми като GPT-3, които могат да пишат впечатляващо последователни статии и дори компютърен код. Но има проблем, който се задава на хоризонта, според екип от AI предсказатели: може да свършат данните, на които да ги обучават.

Езиковите модели се обучават с помощта на текстове от източници като Wikipedia, новинарски статии, научни статии и книги. През последните години тенденцията е тези модели да се обучават на все повече и повече данни с надеждата, че това ще ги направи по-точни и гъвкави.

Проблемът е, че типовете данни, които обикновено се използват за обучение на езикови модели, може да бъдат използвани в близко бъдеще – още през 2026 г., според доклад на изследователи от Epoch , организация за изследване и прогнозиране на изкуствен интелект.

Проблемът произтича от факта, че тъй като изследователите изграждат по-мощни модели с по-големи възможности, те трябва да намират все повече текстове, на които да ги обучават. Тези, грижещи се за големите езикови модели са все по-загрижени, че ще изчерпят този вид данни, казва Тевен Ле Скао, изследовател в компанията за изкуствен интелект Hugging Face.

„Изследователите на езиковия изкуствен интелект филтрират данните, които използват за обучение на модели в две категории: високо качество и ниско качество. Границата между тях може да е неясна“

казва Пабло Вилалобос, изследовател в Epoch.

Данните от категории с ниско качество се състоят от текстове, като публикации в социални медии или коментари на уебсайтове, и значително превъзхождат по количество данните, считани за висококачествени.

Изследователите обикновено обучават само модели, като използват данни, които попадат в категорията с високо качество, защото това е типът език, който искат моделите да възпроизвеждат. Този подход доведе до някои впечатляващи резултати за големи езикови модели като GPT-3.

Един от начините за преодоляване на тези ограничения на данните би бил да се преоцени това, което се определя като „ниско“ и „високо“ качество, според Swabha Swayamdipta, професор по машинно обучение в Университета на Южна Калифорния, който специализира в качеството на набора от данни.

„Ако недостигът на данни накара изследователите на AI да включат по-разнообразни набори от данни в процеса на обучение, това би било „чисто положително“ за езиковите модели“

казва Swayamdipta.

Изследователите могат също да намерят начини да удължат живота на данните, използвани за обучение на езикови модели. Понастоящем големите се обучават на едни и същи данни само веднъж, поради ограничения на производителността и разходите. Но може да е възможно да се обучи модел няколко пъти, като се използват едни и същи данни, казва Swayamdipta.

Други пък смятат, че големината може да не е по-добър подход, когато става въпрос за езикови модели.

Пърси Лианг, професор по компютърни науки в Станфордския университет, казва, че има доказателства, че правенето на моделите по-ефективни може да подобри способността им, вместо просто да се увеличава размера им.

„Видяхме как по-малките модели, които са обучени на данни с по-високо качество, могат да надминат по-големите модели, обучени на данни с по-ниско качество“

обяснява той.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини