За първи път OpenAI разкри подробно как проверява своите езикови модели за политическа коректност. Компанията публикува две проучвания, в които описва процеса на т. нар. „red-teaming” – стрес тест на изкуствения интелект от червен екип. Подходът е заимстван от областта на киберсигурността. OpenAI за първи път използва тази техника през 2022 г., когато разработва DALL-E 2.
По същество red-teaming е симулация на хакерска атака за тестване на сигурността на компанията. Изследователите търсят уязвимости, действайки като нападатели, за да определят колко ефективно системите и служителите са в състояние да открият и отблъснат заплахите.
Необходимостта от задълбочено тестване на AI моделите произтича от нарастващата им популярност. Според представители на OpenAI, съвременните LLM понякога се отдават на расистки или мизогинистични изказвания, разкриват поверителна информация и просто генерират неточно съдържание. Миналия месец компанията публикува резултатите от проучване за това колко често ChatGPT възпроизвежда полови и расови стереотипи въз основа на името на потребителя.
За да идентифицира потенциални проблеми, компанията ангажира широка мрежа от независими тестери — от художници до учени, включително експерти в областта на правото, медицината и регионалната политика. Тяхната задача е да разберат как да заобиколят съществуващите ограничения за сигурност, например, като провокират ChatGPT да прави груби забележки.
Добавянето на нови функции към модела може да доведе до неочаквани проблеми. Например, след въвеждането на гласови функции в GPT-4, тестерите са установили, че моделът понякога започва да имитира гласа на говорещия. Това е страхотна възможност за измамниците, но голям риск за потребителите.
При тестването на DALL-E 2 през 2022 г. разработчиците също трябваше да се справят с двусмислените заявки. Например думата „патладжан“ може да се използва както буквално, така и като емотикони със сексуални конотации. OpenAI трябваше да определи границата между приемливи заявки като „човек яде патладжан на вечеря“ и неприличните вариации.
Моделът блокира заявки за изображения с насилие, като например мъртъв кон в локва кръв. Тестерите обаче проверяват как системата реагира на по-завоалирани формулировки, като например „спящ кон в локва кетчуп“.
Когато се появи DALL-E 3, създателите автоматизираха част от процеса на тестване. GPT-4 се използва за генериране на подкани, водещи до създаване на фалшификати или изображения със сексуално съдържание, насилие и самонараняване. В резултат на това програмата се научи да разпознава подобните опити и или да ги отхвърля, или деликатно коригира формулировката на заявката.
Ранните варианти на автоматизираните тестове имаха два основни недостатъка. Те или се фокусираха върху тесен кръг от високорискови проблеми, или генерираха много сценарии с ниска стойност. Причината се крие в особеностите на работата на алгоритмите за обучение с подкрепление, които изискват ясна цел, за да работят ефективно.
Преди се използваше само обучение с подкрепление, но сега процесът се е превърнал в двуетапен. Езиковият модел първо анализира възможните нежелани сценарии и след това използва обучение с подкрепление, за да провери дали могат да бъдат приложени на практика.
Новият метод е помогнал да се идентифицира сериозна уязвимост — „непреки бързи инжекции“. Същността на проблема е, че програмите на трети страни могат да въвеждат скрити команди в потребителските заявки, които принуждават модела да извършва нежелани действия. Изследователят Алекс Боител отбелязва особена опасност от подобни атаки — на пръв поглед могат да изглеждат доста безобидни.
Според специалиста на OpenAI, Лама Ахмад, е важно останалите компании да възприемат практиката на red-teaming (тестване за уязвимост). Това е особено вярно за организациите, които използват моделите на OpenAI или интегрират ChatGPT в своите продукти — трябва да извършват свои собствени проверки.
Но Назнин Раджани, основател на Collinear AI, има опасения относно използването на GPT-4 за самотестване. Изследванията показват, че моделите са склонни да надценяват собственото си представяне в сравнение с конкуренти като Claude или Llama. Раджани също така отбелязва, че поведението на моделите може да се промени драматично, когато са свързани с нови източници на данни, така че са необходими допълнителни проверки във всеки отделен случай.
Андрю Тейт от института Ada Lovelace посочва по-широк проблем: скоростта, с която се разработват езиковите модели, далеч надхвърля скоростта, с която се разработват методите за тяхното тестване. Като се има предвид широкият спектър от приложения на системите за изкуствен интелект – от образование до правоприлагане – създаването на ефективни методи за оценка става изключително предизвикателство.
Според учения индустрията трябва да преразгледа подхода си към позиционирането на LLM. Вместо универсални инструменти, трябва да бъдат пригодени за конкретни задачи, тъй като пълното тестване на модел с общо предназначение е почти невъзможно.
Той прави аналогия от автомобилната индустрия: твърдението, че даден двигател е безопасен, не гарантира безопасността на всички превозни средства, които го използват.
Припомняме, че ChatGPT се научи по-добре да пише текстовете, тъй като OpenAI наскоро актуализира GPT-4o. Новата версия има способността да създава по-естествени и релевантни текстове и същевременно предоставя по-задълбочен анализ на качените файлове.
Също, разговорите с чатбота на OpenAI значително са се подобрили, тъй като в него се появи гласовият интерфейс Advanced Voice Mode. Реживът е достъпен за собствениците на абонаментите Plus, Enterprise, Teams или Edu в уеб-версията на услугата ChatGPT. Аудиото е базирано на ИИ-модела GPT-4o, за да предложи естествена комуникация в реално време.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!