OpenAI унищожи 100 000 книги, по които беше обучен GPT-3. Хората, участвали в това, също изчезнаха някъде

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

OpenAI е изтрила двата огромни набора от данни „books1“ и „books2“, които са били използвани за обучение на модела GPT-3.

Информацията е на изданието Business Insider, което се позовава на съдебен иск от Authors Guild (Гилдия на авторите).

Същността на иска

Адвокатите на Гилдията на авторите заявиха, че наборите от данни на GPT-3 вероятно съдържат „над 100 000 публикувани книги“. По този начин OpenAI е използвала материали, защитени с авторско право, за обучение на модели на изкуствен интелект.

Справка. Гилдията на авторите е най-старата (създадена през 1912 г.) и най-авторитетната професионална организация на писателите в САЩ. Тя се занимава със защита на свободата на словото и авторското право.

В продължение на няколко месеца Authors Guild изисква от OpenAI да предостави информация за използваните набори от данни. Първоначално компанията отказваше на основание на различни клаузи за поверителност Но след това се оказа, че тя изцяло е изтрила всички копия на данните.

Висококачествените данни за обучение са важна част от мощните модели на изкуствения интелект. OpenAI и други компании използват данни от интернет, включително книги, за да създадат тези модели.

Много от компаниите, които са създали тази информация, сега искат да им се плаща за предоставянето на информация за тези нови AI продукти. Технологичните компании не искат да бъдат принуждавани да плащат. Именно този спор сега се решава в съда в рамките на няколко съдебни дела.

100 000 книги са 16% от обучителните данни на GPT-3

OpenAI унищожи 100 000 книги, по които беше обучен GPT-3. Хората, участвали в това, също изчезнаха някъде

В технологичната документация за 2020 г. OpenAI описва наборите от данни books1 и books2 като „корпус от книги от интернет“ и заявява, че като цяло това са 16 % от данните за обучение, използвани за създаването на GPT-3.

В документа се посочва също, че „books1“ и „books2“ заедно съдържат 67 милиарда лексеми, или около 50 милиарда думи.

OpenAI спря да използва „books1“ и „books2“ за обучение на своите AI модели в края на 2021 г. В средата на 2022 г. те бяха премахнати. Като причина бе посочено, че вече са „неизползваеми“.

Тази документация също така разкрива, че двамата изследователи, които са създали наборите от данни „books1“ и „books2“, вече не работят за OpenAI. OpenAI отказва да разкрие информация за тях, въпреки че гилдията на авторите настоява, че трябва да го направи.

OpenAI поиска от съда да запази в тайна имената на служителите, както и информацията за наборите от данни.

„Моделите, които ChatGPT и нашият API използват днес, не са създадени с помощта на тези набори от данни“,

се казва в изявление на OpenAI от вторник.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

2 Коментара
стари
нови оценка

Нови ревюта

Подобни новини