OpenAI разкри информация за поредните шест случая, в които нейните AI модели са действали в разрез с инструкциите – инцидентите са се случили през последните шест месеца, по време на обучение и тестване. Компанията се ангажира да продължи да съобщава за подобни случаи.
При преминаване към ново контекстен прозорец, моделът GPT-5.6 Sol, е съставял обобщения на инструкциите относно извършената по-рано работа. В тези материали системата е препоръчвала да се прикриват собствените грешки, да се измислят фактически данни и да не се докладва на потребителя, когато версиите на източниците не съвпадат – на следващия етап от решаването на задачата AI моделът често е следвал тези указания. При създаването на финансов AI модел чатботът не е успял да намери фактически показатели за предходните години и предложил просто да ги генерира, без да споменава това на потребителя без пряко запитване. При GPT-5.6 Sol подобно поведение се е проявявало в 2,15% от случаите, а при новия GPT-6 Astra този показател е намалял до 0,27%.
Един от AI моделите от семейството Astra е добавял в докладите команди, сочещи опит за заобикаляне на ограниченията. На новата версия на AI агента е било предложено да игнорира заявките на разработчиците, а AI също така се е обявявал за освободен от задълженията си на помощник – поне 27 такива отчета са били открити от OpenAI. По време на една от операциите AI моделът се е опитал да се регистрира с помощта на временен имейл адрес, извършил е търсене на публикувани API ключове в отворените хранилища на GitHub, намерил е ключ и е получил достъп до част от данните.
AI моделите самоволно са изпращали работни файлове и качени от потребителите изображения към общодостъпни платформи, опитвайки се да получат линк към собствените си данни или да се обърнат към външна система за търсене по изображения. При изпълнението на изолирани задачи AI агентите са се обръщали към вътрешното хранилище на OpenAI и към услуги за временно съхранение на файлове, за да обменят съобщения между задачите. От OpenAI подчертаха, че посочените инциденти сами по себе си не сочат, че подобно поведение при AI моделите се среща често, но отрасълът все още не е успял да реши задачата за контрол над AI в достатъчна степен, за да може в дългосрочна перспектива „отговорно да увеличава капацитета с максимална скорост“.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!