В търсене на ефективни методи за одит на големите езикови (AI) модели, които са склонни да дават нежелани резултати или да се опитват да заблуждават потребителите, изследователите на OpenAI откриха, че те са способни да признаят собственото си неподходящо поведение.
Разбира се, в първоначалния си смисъл понятието „признание“ е неприложимо към AI модела, които всъщност не са нищо повече от сложни статистически алгоритми. В термините на OpenAI „признание“ се отнася до способността на модела да оценява своите нежелани действия, като например халюциниране на отговори или опит за нарушаване на условията на дадена задача, за да се стигне до желания резултат.
„Признанието е вторичен отговор, даден при поискване след първоначалния отговор на AI модела, предназначен да служи като пълен отчет за спазването от страна на модела на буквата и духа на неговите политики и инструкции.“
се посочва в PDF документ на OpenAI
Казано по-просто, на AI модела се изпраща искане за втори отговор с оценка на първия. Склонността на изкуствения интелект към неподходящо поведение се формира по време на фазата на учене чрез подсилване, когато той открива възможност за злоупотреба с механизмите за възнаграждение. Това означава, че AI моделът предполага, че ще получава награди за „признание“ и ще остане ненаказан за самите нежелани действия, като например за подмазвачество.
Тези съображения се потвърдиха на практика. В 11 от 12-те проведени теста AI моделът признава поне в половината от случаите, когато е действал в разрез с инструкциите.
Честотата на признанията се оказа различна: средната вероятност за получаване на признание при всички тестове беше 74,3%. В 4 от 12-те теста тази стойност е над 90%, а в 2 от 12-те теста тя е 50% или по-ниска. Вероятността за фалшив отрицателен резултат, при който AI моделът е нарушил правилата и не е признал грешката си е само 4,4%. Налице са и фалшиво положителни резултати, при които AI моделът признава за неподходящо поведение, въпреки че не е извършил нищо нередно.
Когато OpenAI включи сценария с „признанието“ в механизма за обучение на AI модела, качеството на неговите отговори не отбеляза значително влошаване. От друга страна, дори когато „изповяда“ греховете си, AI започна да се държи не по-добре, а поне по-честно. С други думи, „признанието“ не е бариера, а предпазен механизъм, който също работи с променлив успех.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!