Новият S* фреймуърк помага на AI-моделите да пишат по-добър и по-надежден код

Най-четени

Светослав Димитров
Светослав Димитров
Занимава се със създаване на съдържание за уеб от 2009 г. с над 15000 написани новини за Калдата. Интересува се от SMM, Афилиейт и др.

Новата платформа S* позволява на ИИ базираните езикови модели да генерират по-мощен и надежден код. Изследователи от Калифорнийския университет в Бъркли създадоха фреймуърк, наречена S*, подобряващ начина, по който AI-езиковите модели генерират код. Системата съчетава два различни подхода — паралелно и серийно мащабиране — с нов начин за избор на най-добрите резултати.

Въпреки че генерирането на множество части от код едновременно и изборът на най-добрия (паралелно мащабиране) не е нищо ново, екипът от Бъркли е добавил нещо допълнително. Комбинирали са това с итеративно мащабиране, при което системата непрекъснато подобрява своите решения чрез систематично отстраняване на грешките.

Фреймуъркът въвежда вариация на изчислението по време на тестовете като един от своите градивни елементи. За разлика от настоящите модели за разсъждение като OpenAI o1, S* включва външна обратна връзка, вместо да разчита единствено на вътрешните вериги за разсъждение. Тази конструкция го прави съвместим както с традиционните големи езикови модели (LLM), така и с по-новите модели на разсъждение (LRM).

Втората ключова иновация е това, което екипът нарича „адаптивен входен синтез“. По време на тестовете са използвали GPT-4o mini за генериране на тестови входни данни за различни потенциални решения. Чрез изпълнение на тези входни данни и анализиране на действителните резултати, AI може надеждно да определи най-доброто решение.

Системата иска от AI-модела да създаде тестови входове, специално предназначени за откриване на разлики между двете програми. Той използва внимателно изработените подсказки, които казват на модела да вземе предвид програмните случаи (като празни входове или екстремни стойности), да генерира сложни, но управляеми тестови случаи и да създаде входове, които могат да разкрият потенциални грешки.

След това системата изпълнява и двете програми, като използва тези тестови входни данни и връща резултатите към AI-модела, който решава кое решение се представя по-добре въз основа на реалните резултати от теста.

Екипът е тествал S* с 12 различни езикови модела и различни размери и типове, от което е открил последователни подобрения навсякъде: Qwen2.5-7B-Coder-Instruct със S* се представя с около 10% по-добре от Qwen2.5-32B-Coder-Instruct без него, а в някои случаи по-малките модели, използващи S*, превъзхождат по-големите модели за разсъждение — GPT-4o mini с S* превъзхожда o1-Preview. Дори мощните модели на разсъждение демонстрират подобрение при използване на фреймуърка.

Фреймуъркът има някои ясни ограничения. Понастоящем е оптимизиран само за програмните задачи и не е тестван върху по-сложни софтуерни инженерни задачи. Екипът също така се е фокусирал единствено върху подобряването на точността, оставяйки настрана проблемите с ефективността на ресурсите.

Подход, който съчетава итеративни подобрения с възможности за търсене, вероятно е допринесъл за  успеха на OpenAI в ARC-теста, където са направили множество паралелни заявки към техния модел на разсъждение o3 и са избрали най-добрите отговори, въпреки че точният метод остава неизвестен. S* следва подобна философия и може да доведе до подобрени възможности за генериране на код в бъдеще.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини