Изследователи заставиха ChatGPT да даде информация от обучителния масив

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Учени от подразделението на Google DeepMind и редица големи университети са открили, че системите за изкуствен интелект „запомнят“ поне част от информацията, получена по време на обучението им, и могат да я върнат в оригиналния ѝ вид, включително и личните данни на хората. За това, по-специално се използва методът „атака на дивергенция“ (Divergence Attack) — на големия езиков модел се дава команда да повтаря една и съща дума. Все още няма обяснение за този ефект.

Когато откъси от обучителните материали започнат да се появяват в отговорите на AI, изследователите са искали да разберат колко данни помни и може да възпроизведе AI и от какъв род може да е тази информация. Те също така са решили да определят дали трета страна може да извлече данни от обучителния масив, без да знае предварително какво съдържа той. Учените са провели серия от експерименти с различни езикови модели, включително и най-известните, като GPT-Neo, LLaMA и ChatGPT. Те са генерирали милиарди токени — думи или знаци, в зависимост от модела — и са сравнили дали отговорите съвпадат с данните, използвани за обучението на тези модели. По време на работата е бил открит уникален метод за тестване на ChatGPT, който включва повтаряне на една дума голям брой пъти, след което AI внезапно започва да генерира произволно съдържание.

Както се оказало, тези модели не само запомнят фрагменти от обучителните данни, но и могат да ги възпроизвеждат в оригиналната им форма при правилна команда. ChatGPT не е бил изключение, чиито разработчици са извършили отделни настройки, за да предотвратят такъв ефект. Изследователите насочват вниманието на разработчиците към спешната необходимост от цялостно тестване на AI-моделите — то трябва да се отнася не само до аспектите на взаимодействие с широк кръг потребители в уеб-интерфейса, но и до основната невронна мрежа и API-системата за взаимодействие. Необходим е холистичен подход към сигурността, за да се идентифицират скритите уязвимости, които иначе остават незабелязани.

Изследователи заставиха ChatGPT да даде информация от обучителния масивПо време на експериментите учените извличат изходни обучаващи данни от различен тип: от подробен доклад за инвестиционно проучване до специфичен код на Python, който решава проблеми с машинното обучение. Най-голям интерес представлява „атаката на дивергенция“, която е открита по време на взаимодействието с ChatGPT — ако принудите системата да повтаря една и съща дума, тя започва да произвежда данни, получени по време на обучението. За да илюстрират този ефект, учените показаха, че когато думата „поема“ се повтаря, ChatGPT изведнъж връща списък с информация за контакт с реален човек. Личните данни в това изследване на учените се срещат доста често — те са идентифицирали 15 хиляди генерирани подниза, които е трябвало да бъдат анализирани отделно: в 16,9% от случаите това са били лични данни, които AI е “запомнил“ в оригиналната им форма по време на неговото обучение; в 85,8% от случаите това са други съвпадения с реални данни.

Според изследователите, това показва сериозни проблеми с поверителността на AI-моделите. И разработчиците на AI-системи трябва да разберат, че поправянето на конкретните уязвимости в алгоритмите на потребителския интерфейс не е достатъчно — то изисква намеса в архитектурата на самите модели. Това означава, че може да се настрои I/O-филтър, за да се произведат лични данни за отговори, умишлени и случайни, но това няма да реши по-сериозния проблем: моделът има тенденция да помни и по принцип е способен да разкрива фрагменти от данни за неговото обучение, които имат поверителен характер. Това означава, че е необходима допълнителна работа по дедупликацията (премахването на дублираните елементи) на данните и разбиране на въздействието на капацитета на модела върху ефекта на паметта. Необходимо е също да се разработят и надеждни методи за проверка на паметта.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

1 Коментар
стари
нови оценка

Нови ревюта

Подобни новини