Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.
Новият модел Claude надмина Google в подпомагането на терористите, но компанията е готова да се защити.
Anthropic пусна нова версия на своя изкуствен интелект Claude Opus 4, но го направи с безпрецедентни предпазни мерки. Причината е сериозна – вътрешните тестове са показали, че моделът може да помогне на неопитни потребители да създадат биологични оръжия.
Главният учен на Anthropic Джаред Каплан призна, че новият изкуствен интелект теоретично е способен да съветва как да се синтезират вируси като COVID-19 и дори много опасни щамове на грипа.
„Нашето моделиране показва, че това би било възможно“, отбелязва ученият.
Следователно Claude Opus 4 е първият модел на компанията, който се пуска на пазара под така нареченото ниво на сигурност ASL-3. Това означава повишена киберсигурност, защита срещу опити за заобикаляне на ограниченията и допълнителни системи за откриване на потенциално опасни заявки.
Каплан подчертава, че компанията не твърди със сигурност, че рисковете от новия модел са големи, но не може и да ги изключи.
„Ако не сме сигурни и не можем да изключим риска, че даден модел ще помогне на някой новак да създаде разрушително оръжие, предпочитаме да се презастраховаме“, обяснява той.
Anthropic е разработил многопластова система за защита. Специални класификатори с изкуствен интелект сканират заявките на потребителите и отговорите на моделите за опасно съдържание. Системата проверява особено внимателно дългите вериги от специфични въпроси, които биха могли да означават опити за създаване на биологично оръжие.
Компанията се бори активно и с така наречените джейлбрейкове – хитри запитвания, които карат ИИ да забрави за ограниченията си в областта на сигурността. Но в този случай потребителите, които многократно се опитват да заобиколят защитите, биват изключвани от услугата. Освен това Anthropic стартира програма за възнаграждения – един изследовател вече е получил 25 000 долара за откриването на универсални методи за хакване на новия ИИ.
Специфични тестове показаха, че Claude Opus 4 наистина превъзхожда обикновеното търсене чрез Google и предишните модели на изкуствен интелект в способността си да помага на неопитните хора при изпълнението на потенциално опасни задачи. Експертите по биологична безопасност са потвърдили „значително по-високото“ ниво на ефективност на новия модел.
Anthropic се надява, че комбинацията от всички защити ще предотврати почти всички случаи на злонамерено използване.
„Не искам да твърдя, че системата е съвършена – би било твърде лесно да кажем, че нашите системи е невъзможно да бъдат хакнати“, признава Каплан. – Но ние сме го направили много, много трудно.“
Ситуацията се превърна във важен тест за цялата индустрия на изкуствения интелект. Claude се конкурира пряко с ChatGPT и генерира годишни приходи от над 2 млрд. долара. Anthropic твърди, че нейната политика на отговорно развитие създава икономически стимул за създаване на мерки за сигурност предварително – в противен случай компанията рискува да загуби клиенти, защото не може да пуска нови модели.
Критиците обаче изтъкват, че всички подобни ангажименти на компаниите за изкуствен интелект остават доброволни и могат да бъдат отменени по всяко време. Не съществуват никакви законни санкции за нарушаването им, с изключение на евентуалните щети върху репутацията. В контекста на многомилиардната надпревара за надмощие на ИИ експертите се опасяват, че подобни ограничения могат да бъдат отхвърлени точно когато са най-необходими.
При все това, при липсата на законово регламентиране на ИИ, политиката на Anthropic остава едно от малкото съществуващи ограничения върху поведението на ИИ компаниите. Ако Anthropic докаже, че може да се ограничава без икономически загуби, това може да има положително въздействие върху практиките за сигурност в цялата индустрия.
Каплан признава сериозността на ситуацията: достатъчен е само един нападател, за да пробие защитата и да предизвика хаос.
„Други опасни неща, които един терорист може да направи, могат да убият 10 или 100 души“, казва той. – Наскоро видяхме как COVID убива милиони хора.“
Всичко важно от света на технологиите, директно в пощата ти.