Ново проучване на изследователи от университета Корнел демонстрира, че базираните на изкуствен интелект големи езикови модели могат да деградират от използваното в тяхното обучение нискокачествено интернет съдържание.
Anthropic, OpenAI, Google и други водещи разработчици на ИИ-модели все още разчитат на онлайн съдържанието, за да обучават собствените си LLM. Миналата година беше съобщено, че водещи разработчици на изкуствен интелект са изправени пред недостиг на висококачествени данни за обучението на ИИ, което възпрепятства разработването на по-усъвършенствани модели.
Резултатите от проучването подчертават, че продължителното излагане на нискокачествено съдържание може да повлияе негативно на когнитивните способности, преценката и концентрацията на хората. Същото важи и за изкуствения интелект. Изследователите са използвали два показателя, за да оценят и идентифицират нискокачественото съдържание.
Първият тест се фокусира върху ангажираността с кратки, вирусни публикации, които генерират високи нива на ангажираност. Вторият тест е насочен към семантичното качество и включва предимно публикации с ниско качество, заглавия и стилове на писане, подобни на кликбайт.
Изследователите са използвали тези показатели, за да създадат набори от данни, съдържащи различни количества ненужна или висококачествена информация. Те са използвали тези набори от данни, за да определят въздействието на нискокачественото съдържание върху LLM, като например Llama 3 и Qwen 2.5.
Проучването показва, че точността на изложените изключително на нежелано съдържание LLM е намаляла от 74,9% на 57,2%. Способността им да разбират съдържанието в дългосрочен план също е намаляла от 84,4% на 52,3%. Изследователите установиха, че когнитивните способности на потребителите и способността им да разбират AI-моделите се влошават само при продължително излагане на нискокачествено съдържание.
Проучването установява също, че продължителното излагане на нискокачествено съдържание нарушава етичната последователност на ИИ-моделите, което води до така нареченото „личностно отклонение“. Това прави LLM още по-непредсказуеми и податливи на неправилни отговори. Нискокачественото съдържание често е карало AI-моделите да изоставят последователни алгоритми за разсъждение и прибързано да генерират повърхностни отговори.
През последните няколко месеца водещи фигури в технологичната индустрия, включително и съоснователят на Reddit Алексис Оханян и главният изпълнителен директор на OpenAI Сам Алтман, предизвикаха дебат за превръщането на „теорията за мъртвия интернет“ в реалност. Според Алексис Оханян с появата на чатботовете голяма част от интернет вече е умрял. Той обаче прогнозира появата на ново поколение социални мрежи, които ще бъдат по-подходящи за хората.
Сам Алтман също твърди, че „теорията за мъртвия интернет“ се превръща в реалност пред очите ни. Главният изпълнителен директор на OpenAI заяви още, че повечето акаунти в социалната мрежа X се управляват от LLM специалисти.
Миналата година проучване на Amazon Web Services (AWS) показа, че 57% от публикуваното в интернет съдържание е създадено или преведено с помощта на ИИ-алгоритми. Това се отразява негативно върху качеството на резултатите от търсенето.
Резултатите от проучването бяха публикувани на сървъра arXiv.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!