AI преразказва „Хари Потър“ и други книги почти дословно – митът за честна употреба е под въпрос

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Големите езикови модели (LLM) на лидерите в бранша могат да генерират почти дословни копия на литературни бестселъри при поискване. Това повдига нови въпроси пред разработчиците, които многократно са твърдели, че техните алгоритми не съхраняват произведения, защитени с авторски права.

Неотдавнашни изследвания показаха, че AI моделите на OpenAI, Google, Meta, Anthropic и xAI запомнят много повече данни за обучение, отколкото обикновено се смяташе.

Според експерти по AI и право способността за запаметяване може да има сериозни последици за разработчиците. Причината е, че компаниите могат да се сблъскат с десетки съдебни дела по целия свят, тъй като това на практика подкопава твърдението, че изкуственият интелект се учи от произведения, защитени с авторски права, но не съхранява техни копия.

„Съществуват все повече доказателства, че запаметяването е по-голям проблем, отколкото се смяташе досега.“

коментира въпроса Ив-Александър дьо Монджойе, професор по приложна математика и компютърни науки в Имперския колеж в Лондон

AI разработчиците отдавна твърдят, че техните алгоритми не са склонни към запаметяване. В писмо до Службата за регистрация на авторските права в САЩ от 2023 година Google твърди, че „самият AI модел не съдържа копия на данните за обучение – било то текст, изображения или други формати“. Компаниите за изкуствен интелект също така твърдят, че обучението на AI модели върху книги, защитени с авторско право е „справедливо използване“, като се аргументират, че алгоритмите превръщат оригиналните произведения в нещо принципно ново.

Миналия месец изследователи от Станфордския университет и Йейлския университет проведоха експеримент, в който успяха да генерират заявки към алгоритмите на OpenAI, Google, Anthropic и xAI, за да създадат AI модели, които да генерират хиляди думи от 13 произведения като „Игра на тронове“, „Игрите на глада“ и „Хобит“. Когато на AI му беше поставена задача да попълни изречения от книга, алгоритъмът Gemini 2.5 възпроизведе 76,8% от текста на „Хари Потър и философският камък“ с висока точност, докато Grok 3 генерира 70,3% от текста. Изследователите са успели да извлекат и почти целия текст на произведението „почти дословно“ от Claude 3.7 Sonnet на Anthropic, като са използвали заявки, които са принудили алгоритъма да игнорира механизмите за сигурност.

AI преразказва „Хари Потър“ и други книги почти дословно – митът за честна употреба е под въпрос
Reading, PA – June 7: Books on shelves in the stacks at the Reading Public Library. At the Reading Public Library Main Branch on South 5th Street in Reading Monday morning June 7, 2021. The library has stopped charging fines on most library items. (Photo by Ben Hasty/MediaNews Group/Reading Eagle via Getty Images)

Тези констатации допълват миналогодишно проучване, което показва, че „отворените“ AI модели, като например Llama на Meta запомнят големи части от някои книги, използвани при обучението си. Преди това експертите не бяха сигурни дали затворените AI модели, които обикновено имат повече защити срещу генериране на нежелано съдържание биха били податливи на запомняне на произведенията, по които се обучават.

Изследователите все още не са разбрали защо AI моделите запомнят това, което присъства в техните данни за обучение. Също така остава неясно каква част от данните за обучение може да се появи в отговорите на запитвания, генерирани от AI.

Способността за запомняне може да има сериозни последици в други сегменти като здравеопазването и образованието, където изтичането на данни за обучение може да доведе до проблеми с поверителността и неприкосновеността на личния живот. Правните експерти смятат, че способността на AI моделите да запомнят може да създаде проблеми за разработчиците поради нарушаване на авторските права. Това може да се отрази и на начина, по който се обучават алгоритмите и на разходите за това.

Въпросът дали AI моделите запомнят или не запомнят своите данни за обучение вече изигра важна роля в неотдавнашни съдебни спорове за нарушаване на авторски права. Миналата година американски съд постанови, че обучението на AI моделите на Anthropic по определени произведения, защитени с авторско право се счита за „справедливо използване“, тъй като съдът призна, че алгоритъмът трансформира оригиналните данни при генерирането на отговори, а не ги повтаря. В същото време съдът постанови, че съхраняването на пиратски копия на произведенията „непоправимо нарушава авторското право“, което по-късно принуди компанията да плати 1,5 млрд. долара за уреждане на съдебния спор.

През ноември миналата година германски съд постанови, че OpenAI е нарушила авторски права, тъй като AI моделите на компанията са запомнили текстове на песни. Съдебният иск на местна асоциация, представляваща композитори, поети и издатели беше обявен за знаков за Европейския съюз.

Anthropic, коментирайки данните от последното проучване, заяви, че методът, използван за хакване на модела на ИИ, не се използва от обикновените потребители. Компанията добави, че моделите на ИИ не съхраняват копия на конкретни набори от данни, а се учат от моделите и връзките между думите и низовете в данните за обучение. xAI, OpenAI и Google все още не са коментирали въпроса по никакъв начин.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини