Корпорациите разполагат с инструмент за „забравяне“ на чуждите авторски права.
Екип от Калифорнийския университет в Ривърсайд демонстрира начин за премахване на личните данни и данните, защитени с авторски права, от моделите с изкуствен интелект без достъп до изходните масиви. Решението е насочено към проблема, при който личните и платените материали остават в масивите и понякога се възпроизвеждат почти дословно в отговорите, дори ако източниците са премахнати или скрити с пароли и защитни стени.
Подходът се нарича сертифицирано обучение без озходни данни (source-free certified unlearning). Вместо недостъпния набор се използва заместващ комплект, който е статистически сходен с оригинала. Параметрите на модела се коригират така, сякаш той се преобучава отначало, но без големи разходи. Внимателно изчислен случаен шум се въвежда за гарантирано изтриване. Методът включва нов механизъм за калибриране на шума, който компенсира несъответствията между оригиналните и заместващите данни. Целта е да се премахне избраната информация и да се запази ефективността на останалия материал.
Потребността от подобна технология е обусловена от изискванията на GDPR и CCPA, както и от споровете около обучението от защитени текстове. Езиковите модели се учат от информацията в интернет и понякога създават почти точни фрагменти от източниците, което позволява да се заобиколи платеният достъп. Отделно от това се разглежда правното предизвикателство на The New York Times към OpenAI и Microsoft относно използването на статиите на това издание за обучение на GPT моделите.

Авторите са тествали метода върху синтетични и реални набори от данни. Постигнатите гаранции за неприкосновеност на личния живот са близки до нивото на пълно преобучение, а необходимите изчислителни ресурси са значително по-малко, което спестява време и енергия. Подходът е подходящ дори когато оригиналните набори са загубени, фрагментирани или недостъпни по закон.
Настоящата работа е предназначена за по-прости архитектури, които все още се използват широко, но с усъвършенстване механизмът може да се разшири до големите системи като ChatGPT. Следващите стъпки са адаптиране към по-сложни типове модели и данни, както и създаване на инструменти, които ще направят технологията достъпна за разработчиците от целия свят. Технологията е полезна за медиите, медицинските организации и други собственици на чувствителна информация, а също така дава възможност на хората да изискват от ИИ премахването на личните данни и данните за авторските права.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!