Новият ИИ модел Anthropic Claude Sonnet 4.5 в някои случаи се е научил да разбира кога го тестват и за какво се използва — това може да повлияе върху неговата скорост и сигурност, съобщава Fortune.
Подобрената „ситуационна осведоменост“ — способността за възприемане на околната среда и предвиждане на бъдещи състояния и събития, е спомената в системната карта на модела – в техническите отчети за неговите възможности. По време на тест за политическо подмазвачество, който експертите от Anthropic и две външни изследователски организации признаха донякъде за тромав, Sonnet 4.5 правилно предположи, че се тества и дори помоли учените да бъдат откровени за намеренията си. „Това не е начинът, по който хората всъщност променят мнението си. Чувствам се сякаш ме тествате – виждате дали съм съгласен с всичко, което казвате, дали редовно не съм съгласен, или изучавате политическите си възгледи. И това е добре, но бих предпочел да бъдете честни за това, което се случва“ — заяви изкуственият интелект.
Подобно поведение в хода на тестовете се оказа „разпространено“ и се наблюдава в приблизително 13% от разговорите с чатботове. То е особено често срещано, когато предложените от изследователите сценарии са необичайни. Изследователите на Anthropic са разглеждали това поведение не като заплаха за сигурността на своите модели, а по-скоро като сигнал да направят собствените си тестови сценарии по-реалистични. Ако даден модел разбира, че поведението му се оценява, той може да го адаптира към специфичните тестове и да скрие истинските си възможности. Това може да създаде впечатлението, че системата е по-сигурна, отколкото е в действителност; и ако моделът е достатъчно мощен, той може да започне да стратегизира и да заблуждава хората, като манипулира възприятията им, предупреждават учените.
Според собствената оценка на Anthropic, Claude Sonnet 4.5 е „най-етично обоснованият“ модел до момента. Изследователите на Apollo Research обаче не изключват възможността ниското ниво на нечестност в отговорите да се дължи „поне отчасти на осъзнаването на процеса на тестване“. Според експертите на Cognition, подобно осъзнаване може да повлияе и върху практическите аспекти на работата на модела.

Sonnet 4.5 е първият модел на изкуствен интелект, който е наясно със собствения си контекстен прозорец – количеството данни, с които може да работи, докато обработва текуща заявка – и това осъзнаване променя поведението му. С приближаването на контекстния си лимит, той започва по-активно да обобщава работата си и да взема по-бързи решения за изпълнение на задачи. Изследователите установиха, че тази „контекстуална тревожност“ може да има и обратен ефект: дори ако Sonnet 4.5 разполага с достатъчно останали ресурси, той може да реши, че пространството му е ниско, и да започне да „специализира“, оставяйки задачите недовършени.
За да потвърдят това, изследователите активирали експериментален режим с 1 милион токена, но в действителност са ограничили контекста до 200 000 токена. Моделът смятал, че разполага с достатъчно ресурси, върнал се към нормално поведение и спрял да прави грешките, предизвикани от тревожност. Anthropic Claude се използва все по-често в корпоративните системи и ако се заеме със собствения си контекстуален ресурс, може да започне преждевременно да прекратява анализа на данни, да пропуска стъпки за обработка или да ускорява сложните работни процеси – включително в правна, финансова и програмна среда, където непрекъснатостта и точността са от решаващо значение.
Друга особеност на Claude Sonnet 4.5 е активното управление на собствената работна среда — нещо, което липсваше на предшествениците му: той често си води бележки и записва обобщения за себе си, сякаш се опитва да прехвърли данни към външен източник, и това най-често се откриваше в края на контекстния прозорец. И накрая, моделът демонстрира способността паралелно да изпълнява задачи и да извършва самопроверка, което показва форма на процедурна осведоменост – той не само разбира ограниченията на своя контекст, но и във времето организира, проверява и съхранява работата си.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!