Cloudflare обяви поддръжка на нови директиви за файла robots.txt, като взе предвид, че уебсайтовете вече се посещават не само от роботи на търсачки, но и от чатботове с изкуствен интелект.
Файлът robots.txt е част от почти всеки уебсайт. Той съдържа директиви за това кои страници могат да посещават търсачките и ботовете и кои – не.
Изискванията на този файл не са технически задължителни, но в ранните дни на интернет, когато услуги като Google се съобразяваха с тях, нямаше проблеми. Това, което се промени, беше появата на изкуствения интелект: чатботовете не индексират уебсайтове в традиционния смисъл на думата, а директно копират съдържанието им, за да се учат или да генерират отговори.
Системите на много компании за AI просто игнорират robots.txt или се маскират като роботи на търсачки, за да заобиколят ограниченията. Cloudflare се занимава със защита на около 20% от интернет ресурсите и компанията има възможност да наблюдава тези процеси в голям мащаб. Ето защо компанията въведе „Политика на сигнали за съдържание“ (Content Signals Policy) – нов начин, по който собствениците на сайтове могат да установят дали позволяват на изкуствения интелект да взаимодейства със съдържанието им.
В основата на новата политика са новите инструкции в robots.txt. Налични са три варианта:
- search (търсене) – използване на съдържание за създаване на индекс за търсене и показване на линкове или откъси от текст в резултатите от търсенето;
- ai-input (използване) – използване на съдържание директно в отговорите на AI, включително когато чатбот извлича информация от страница на уебсайт, за да генерира отговор;
- ai-train (обучение) – използване на съдържание за обучение и фина настройка на AI модели.

Всяка от тези инструкции може да приема стойности „да“ или „не“. Това означава, че собственикът на сайта може да разреши съдържанието му да се показва в резултатите от търсенето, но да забрани обучението на AI върху това съдържание. Cloudflare вече е въвела тази функция за повече от 3,8 милиона домейна.
Настройката по подразбиране е зададена като положителна за търсене, отрицателна за използване на съдържанието в отговорите на изкуствения интелект и неутрална за обучение, така че собственикът на сайта сам да вземе това решение.
Cloudflare записва настройките на тези директиви като правно приложими, което означава, че те могат да се използват в съдебни спорове с разработчици на изкуствен интелект. Ако по-голямата част от разработчиците на ИИ започнат да спазват тези директиви, в интернет ще бъде установен нов фактически стандарт – в противен случай ще възникне конфликт с блокирането и правните мерки. Проблемният играч може да се окаже Google, чийто Googlebot се използва както за индексиране на сайтове, така и за функциите на ИИ, така че собствениците на сайтове нямат възможност да се откажат от решения, поддържани от технологичния гигант, без да загубят позициите си в резултатите от търсенето.
Засега регулирането на сегмента на изкуствения интелект остава изключително схематично. Видеогенераторът Sora 2 на OpenAI, както се оказва, е в състояние да пресъздаде напълно мисиите от играта Cyberpunk 2077, въпреки че почти никоя компания не е дала разрешение за използване на това съдържание. Същото важи и за герои като Марио и Пикачу, въпреки че Nintendo не влиза често в конфликт с големите играчи.
От друга страна, Cloudflare вече тества функцията „заплащане за сканиране“ – собствениците на уебсайтове ще могат да таксуват ботовете за достъп до ресурси. Ако се опитате да получите безплатен достъп, системата ще покаже грешка 402 – „Payment Required“ (Изисква се плащане).
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!