Проблем в китайската версия на GPT-4o води до влошаване на производителността и грешни отговори.
OpenAI представи най-новия си модел на изкуствен интелект GPT-4o (Omni) на 13-ти май. Но само няколко дни след появата на модела китайските потребители забелязаха, че нещо в новата версия не е наред: токените, използвани за анализ на текст, съдържат много спам и порнографски фрази.
На 14-ти май Тианле Цай, докторант в Принстънския университет, който изучава ефективността на изводите при големите езикови модели, получи достъп до публичната библиотека с токени и състави списък на 100-те най-дълги токена на китайски език, използвани от модела за обработка на китайски заявки.
Оказа се, че само 3 от тях са достатъчно разпространени, за да се използват в ежедневните разговори; останалите са думи и изрази, свързани с хазарта и порнографията. Най-дългият лексема съдържа 10,5 китайски знака и буквално означава „безплатно японско порнографско видео за гледане“.

От OpenAI засга не дават коментар за ситуацията.
Предполагаше се, че GPT-4o ще превъзхожда своите предшественици в справянето с многоезичните задачи благодарение на своя нов инструмент за токенизация, който по-добре компресира текстовете на неанглоезични езици. Експертите обясняват това с недостатъчното прочистване на данните преди обучението на модела.
Неправилните лексеми затрудняват модела да разбере значението им, което може да доведе до генериране на грешни или опасни отговори, което позволява на изследователите да заобиколят мерките за сигурност на OpenAI.
Най-лесно е моделите да обработват текст символ по символ, но това изисква повече време и ресурси. Токените, които представляват поредици от символи с определена стойност, позволяват на модела да работи по-бързо и по-ефективно. С пускането на GPT-4o компанията OpenAI въведе нов токенизатор, който добави поддръжка за неанглоезични езици. Новият токенизатор разполага с общо 200 000 токена, около 24% от които са на други езици, включително руски, арабски и виетнамски.

Инвеститорът в изкуствен интелект Диди Дас смята, че основната полза от новия токенизатор е по-скоро намаляването на разходите за обработка на заявки на тези езици, отколкото подобряването на качеството. Дас също така отбеляза, че токените на хинди и бенгалски отразяват дискусии за хора, включително имена и титли, без спам и порнографски език, за разлика от китайските токени.
Разликата се дължи на качеството на данните за обучение: китайските токени, които съдържат много спам думи, използвани в контекста на порнографията и хазарта. Това предполага, че корпусът от данни за китайски език е бил замърсен и не е бил правилно почистен.
Такива замърсени данни биха могли да бъдат резултат от практиката на спам сайтовете, които вграждат рекламите си в съдържанието на други сайтове, за да заобиколят филтрите и да бъдат индексирани от търсачките, както се потвърждава от китайските потребители, които съобщават за честата поява на спам сайтове в резултатите от търсенето в Google.
Дас твърди, че решението на проблема със спама не е сложно и може да включва прости техники за филтриране. Въпреки това OpenAI, според Дас, не е почистила адекватно данните за китайския език, преди да пусне GPT-4o. Заслужава да се отбележи, че подобни проблеми не съществуваха в предишните версии – GPT-3.5 и GPT-4.

Потребителите също така са открили, че токените могат да се използват за заобикаляне на защитните механизми на модела, като го принуждават да генерира забранени отговори. Например, заявка за превод на дълги китайски лексеми може да доведе до появата на думи, които не са включени в заявката, което е знак, че моделът „халюцинира“.
Проблемът възниква, когато токенизаторът и самият езиков модел са обучени върху различни набори от данни. Поради тази причина моделът не разбира рядко използваните лексеми, което може да доведе до странни и несигурни отговори.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!