OpenAI провери как големите езикови модели (LLM) се справят с програмирането и дали както се опасяват мнозина от нас, те скоро ще заменят хората в първите редици на развойната дейност. В рамките на теста компанията взе 1488 задачи от платформата Upwork – от малки поправки до пълноценни големи проекти.
Upwork е най-голямата в света платформа за фрийлансъри, където клиентите намират изпълнители за различни задачи: от програмиране и дизайн до копирайтинг и виртуална помощ. В платформата са регистрирани повече от 20 милиона фрийлансъри от цял свят и около 5 милиона клиенти. Услугата поема ролята на посредник: гарантира заплащане на работата, предоставя инструменти за комуникация и управление на проекти и помага за разрешаване на спорове между клиенти и изпълнители.
В експеримента участваха три усъвършенствани LLM: GPT-4o и o1 от OpenAI и Claude 3.5 Sonnet от Anthropic. Те трябваше да свършат работа, за която фрийлансърите получиха общо над един милион долара. Беше важно не само да се напише код, но и да се реши как да се реализира технически всеки проект.
Задачите варираха значително по сложност и цена: от прости поправки на грешки за 50 долара до сериозни проекти, струващи 32 000 долара. Приблизително 35% от всички задачи струваха повече от 1000 долара, а други 34% бяха оценени на стойност между 500 и 1000 долара. Цената съответстваше на действителните плащания, които фрийлансърите получаваха за работата си.
ИИ трябваше да създава мобилни и уеб приложения, да свързва API, да настройва работата с браузъри и външни програми и да се справя със сложни грешки. Всяко решение първо беше подложено на автоматични тестове, а след това беше тествано от трима опитни програмисти.
Всеки LLM се изпробваше и в ролята на технически ръководител: трябваше да взема стратегически решения за архитектурата на приложенията, да избира подходи за разработка и да определя приоритетите за развитие на дадена инициатива. Изборите на ИИ бяха сравнени с действителните решения на ръководителите, които преди това са ръководили тези проекти.
Интересно е, че голяма част от задачите (около 90%) не са били свързани със създаването на нова функционалност, а с отстраняването на съществуващи проблеми в кода.
Claude 3.5 Sonnet се представи най-добре. В ситуациите, в които беше необходимо просто да програмира, той се е справил с 26,2% от задачите – това би му донесло 208 000 долара от възможните 500 000 долара. Когато трябваше да се справя в ролята на ръководител, изкуственият интелект на Anthropic постигна резултат от 44,9% , което съответства на 400 000 долара от един милион възможни.
Проучването обръща специално внимание на задачите от категория „Диамант“ – най-сложните проекти, за чието изпълнение дори опитни експерти в GitHub отделят средно 26 дни. По време на процеса всички имали много въпроси – коментарната тема обикновено нараствала до 50 поста. Разбира се, тук Клод 3,5 се справи по-добре, въпреки че точният процент на успеваемост в тази категория беше много по-нисък. За да се получат възможно най-честни резултати, моделите бяха изпълнени в изолирана среда Docker без достъп до външни ресурси – нямаше готови отговори.
Изследването на OpenAI (което, между другото се нарича SWE-Lancer) е забележително, защото за първи път ИИ беше тестван върху реални търговски продукти, използвани от милиони хора. Преди това тестовете се провеждаха само върху специализирани хранилища с изходен код – такива задачи, които са интересни за тесен кръг разработчици.
Между другото, по време на експеримента уменията на самите големи езикови модели забележимо са се повишили. Например, GPT-4o, който през август 2024 година се справяше само с 1/3 от задачите, в новата си версия (o3) успя да реши успешно 72% от заданията. OpenAI вярва, че когато невронните мрежи се научат да програмират на нивото на човека, това ще направи висококачествените разработки по-достъпни и ще ускори технологичния прогрес. В същото време компанията разбира рисковете за пазара на труда, особено за начинаещите.
Въпреки непрекъснатото обучение се оказа, че интелигентните алгоритми все още са далеч от това да заменят истинските програмисти.
Дори най-усъвършенстваните системи не можеха да се справят с повечето задачи: често допускаха грешки в сложната бизнес логика, не можеха да интегрират ефективно различни технологии и изпитваха трудности при отстраняване на нетривиални проблеми. Все пак, изследването SWE-Lancer откри нов начин за оценка на ИИ през призмата на реалната икономика: вече е възможно да се каже точно каква част от работата на реалните специалисти е по-лесно да се автоматизира и колко струва това.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!