Софтуерният пакет DrEureka дава възможност на всеки да обучава роботи с помощта на големите езикови модели от типа на ChatGPT 4. Системата използва принципно нов подход – „учене от нулата“, при който роботът усвоява сложни умения във виртуална среда с помощта на GPT подсказки. След това преминава към изпълнение на задачи в реалния свят. Така например разработчиците са успели да научат робота да балансира и да ходи върху топка за йога единствено чрез симулационно обучение. При обучението на робота DrEureka знаително превъзхожда хората, като постига 34% увеличение на скоростта и 20% увеличение на изминатото разстояние в сравнение с обучен от хората робот.
DrEureka е нов софтуерен пакет с отворен код, който е достъпен за всички. Той дава възможност за обучение на роботи за изпълнение на реални задачи с помощта на големи езикови модели като GPT-4. Роботите се обучават във виртуална среда със симулирана физика, преди да преминат към изпълнение на действия в реалния свят. Разработчикът на DrEureka, д-р Джим Фан, привлече вниманието към проекта, като използва четирикракия робот Unitree Go1 с отворен код.
„Успяхме да научим робота да балансира и да ходи върху топка за йога единствено чрез симулационно обучение. Не беше необходимо допълнително адаптиране – роботът веднага се представи много добре в реалния свят“,
пише Фан в X.
При симулацията на случаен принцип се определят различни параметри, като например триене, маса, демпфиране, център на тежестта и др. Нужни са само няколко подсказки за някой голям езиков модел като ChatGPT. След това изкуственият интелект може да напише код, който създава система за награди/наказания за обучение на робота във виртуалното пространство. В него 0 означава неуспех, а всяка стойност над 0 – успех. Колкото по-висок е резултатът, толкова по-добре.
Тази система може да създава параметри чрез минимизиране и максимизиране на точките на неуспех/загуба на робота в различните области. Така например тя избира оптималната еластичност на топката, мощността на двигателя, степените на свобода на крайниците и демпферирането. Поради своето естество LLM е в състояние да генерира огромен брой такива варианти на параметри. А това позволява на системата за обучение да се справя с голямо количество данни. След всеки симулационен цикъл ChatGPT анализира колко добре се е справил виртуалният робот и как може да бъде подобрен. Превишаването или нарушаването на параметрите, като например прегряване на двигателя или опит за преместване на крайник извън неговите възможности, ще доведе до нулев резултат.
Може би това е началото на една нова еволюция, при която машини обучават машини без каквото и да било участие от страна на човека.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!