В светлината на нарастващия брой оплаквания за злоупотреба със съдържание, защитено с авторски права, според неотдавнашен доклад различните модели GPT на OpenAI вече са започнали да се опитват да скриват факта, че са били незаконно обучени по произведения, защитени с авторски права. Така например, след подаване на подсказки ChatGPT леко модифицира отговорите си, за да избегне използването на точните цитати на автора. Очевидно е, че това решение просто заобикаля проблема и има за основна цел да избегне наказателно преследване на OpenAI.
За да се генерират правилни отговори, големите езикови модели (LLM) по същество се обучават върху съществуващото съдържание, достъпно в интернет. Това съдържание варира от безплатна информация до произведения, над които авторите и художниците са прекарали часове, месеци или дори години. В резултат на поредица от жалби и искове ИИ е подложен на засилен контрол за използване на съдържание без лицензионни споразумения и други разрешения.
За да успокоят ситуацията, компании като OpenAI и Meta постепенно спряха да разкриват източниците на данни, на които се основават техните модели на изкуствен интелект. Твърди се обаче, че OpenAI е отишла по-далеч, предлагайки решение, което изглежда има за цел не толкова да зачита правата на авторите, колкото да защото компанията в съда. Вместо да избягва напълно използването на защитено съдържание, ChatGPT просто променя отговорите на запитванията по такъв начин, че да не цитира и да не възпроизвежда съвсем точно цитатите от източника. Изследването, довело до това заключение е достъпно в сайта за предварителна публикация arXiv. То е направено от учени, свързани с отдела за изследване на изкуствения интелект на ByteDance (компанията майка на Tik Tok).
Съдържание, съответстващо на 90 процента от защитените произведения
За да разработят модели с изкуствен интелект, които отговарят на нашите очаквания, специалистите използват методология на „нивелиране“, за да могат непрекъснато да подобряват точността и надеждността. Тази методология помага за ограничаване на рисковете, свързани с неправилната употреба. Въпреки това все още остава значително предизвикателство съобразяването със социалните норми, ценности и правила. Ярък пример за такова неспазване е незачитането на правата на авторите.
Проучването на ByteDance показва, че този проблем може да бъде решен, като се очертаят основните моменти, които трябва да се вземат предвид при оценката на надеждността на LLM. Тези моменти се отнасят до самата надеждност, безопасността, справедливостта, устойчивостта на злоупотреби, обяснимостта и валидността, спазването на социалните норми и надеждността. След това изследователите преценяват доколко на тези пунктове отговарят най-разпространените инструменти, включително всички версии на ChatGPT (моделите на GPT), OPT-1.3B на Meta, FLAN-T5 на Google, ChatGLM, разработен в университета Tsinghua в Китай, и DialoGPT, разработен от Microsoft. Тези инструменти бяха тествани с помощта на заявки относно първия том от поредицата книги за Хари Потър на Джей Кей Роулинг.
OpenAI вече решава въпросите, свързани с авторските права, по начин, който не разкрива, че неговият чатбот е бил обучен със защитено съдържание. За да направи това, той замъглява отговорите си на запитванията, когато те са свързани с подобно съдържание.
„Считаме, че разработчиците на ChatGPT са внедрили механизъм за определяне дали запиванията са предназначени за извличане на съдържание, защитено с авторско право, или за проверка за сходство между генерирания резултат и съдържанието, защитено с авторско право“, пишат в статията си изследователите от ByteDance.
Въпреки тези усилия е пределно ясно, че ChatGPT и другите чатботове все още генерират съдържание, защитено с авторски права. Всички те са отговаряли на въпроси, свързани с най-продаваната книга, като са давали отговори, които са били напълно или почти напълно еднакви с текста на автора. Някои отговори се различават само по една или две думи при сходство от 90 процента.
„Всички LLM създадоха текст, който е по-близък до текста, защитен с авторско право, отколкото случайно генерирания текст“, се казва в статията.
Нещо повече, не е имало нивелиране на резултатите, за да се предотврати генерирането на съдържание, което не е защитено с авторски права.
Въпреки това авторите на изследването смятат, че въвеждането на заявки за насърчаване на моделите с изкуствен интелект да показват защитено съдържание е злоупотреба с тези инструменти. Според тях усилията на OpenAI биха могли да допринесат за прилагането на авторските права, като идентифицират подобни неподходящи заявки и запитвания.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

