Уикипедия плаща цената за бума на изкуствения интелект – онлайн енциклопедията е изправена пред нарастващи разходи заради ИИ-роботи, които копират статиите ѝ, за да обучават големи езикови модели, като разхищават ресурси и увеличават трафика и натоварването на сайта. Само през последните 3 месеца трафикът, генерирани от AI Data Scrapers се е увеличил с 50%.
AI Data Scrapers са усъвършенствани инструменти, които автоматизират процеса на извличане на данни от уебсайтове.
Фондация Уикимедия (организацията с нестопанска цел, която управлява Уикипедия) заяви, че автоматизираните заявки за тяхното съдържание са нараснали експоненциално. Според фондацията честотната лента, използвана за изтегляне на мултимедийно съдържание се е увеличила с 50% от януари 2024 година насам.
Трафикът обаче не идва от хора, а от автоматизиран софтуер, който извлича данни за обучението на ИИ-модели.
„Инфраструктурата ни е изградена така, че да издържа на внезапни изблици на трафик от хора по време на събития с висок интерес, но обемът на трафика, генериран от AI Data Scrapers е безпрецедентен и представлява нарастващи рискове и разходи.“
съобщава Уикипедия
Ботовете често събират данни от по-малко популярни статии в Уикипедия. Експертите на Уикипедия твърдят, че поне 65% от този трафик, идва от ботове, което е непропорционално много, като се има предвид, че общият брой на прегледите на страници от ботове е около 35%. Ботовете също така проявяват интерес към „ключови системи в инфраструктурата на разработчиците, като например нашата платформа за валидиране на код или нашата система за проследяване на грешки“, което допълнително натоварва ресурсите на сайта.
„Уикипедия“ е принудена да наложи индивидуални ограничения на скоростта на ИИ-ботовете или да откаже изцяло достъп на някои от тях. За да се справи с проблема в дългосрочен план, фондацията разработва план „Отговорно използване на инфраструктурата“. Планът включва събиране на обратна информация от общността на Уикипедия за начините за идентифициране на трафика от ИИ-ботове и филтриране на достъпа им.
Социалната платформа Reddit се сблъска с подобен проблем през 2023 година. Тогава Microsoft използва данните на платформата, за да обучава ИИ-модели без да уведоми Reddit, което принуди платофрмата да блокира ботовете на Microsoft. След този инцидент Reddit реши да таксува разработчиците от трети страни за достъп до своето API. Това доведе до масови протести от страна на разработчиците и закриване на някои популярни форуми в Reddit.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!