Базираната в Сан Франциско компания Physical Intelligence представи модела на робот π 0.7, който може да комбинира научените умения, за да изпълнява нови задачи – от управление на непознати уреди до сгъване на пране. Моделът се учи чрез езикови инструкции, прехвърля уменията си между различните роботи и показва точност, близка до човешката. Публикацията съвпадна с плановете на Physical Intelligence да набере 1 млрд. долара инвестиции.
Постижението на изследователите е т.нар. композиционна генерализация – способността да се комбинират вече научени умения за решаване на нови проблеми. Например, моделът може да използва непознати кухненски уреди или да научи друг робот да сгъва пране, дори ако данните за обучение не са съдържали такива примери. Преди това подобни способности се считаха за характерни по-скоро за езиковите модели, отколкото за системите за роботика.
Моделът принадлежи към класа „зрение-език-действие“ (VLA) и управлява роботите въз основа на мултимодални данни. Той обработва текстовите инструкции, визуалните сигнали и контекста на задачата, което му позволява да действа гъвкаво и да се съобразява със средата. В същото време π 0,7 показва висока точност на манипулиране и стабилност при сложни операции.
Новата система от подсказки за обучение описва не само самата задача, но и начина, по който тя се изпълнява. По време на обучението моделът получава текстови инструкции, метаданни (напр. изисквана скорост или качество), вид на управлението и визуални подцели – изображения на това как трябва да изглежда междинният резултат. Това позволява хетерогенните данни да бъдат обединени в една система. Тази архитектура прави възможно използването на по-широк набор от данни. Дори данни с по-ниско качество или непълни данни могат да бъдат включени в обучението чрез подходящо разделяне, което увеличава мащабируемостта на модела.
При експериментите моделът показа способност да научава нови задачи, като използва езикови инструкции. Например при работа с аерогрил роботът първоначално изпълнява действията с грешки, но след обяснения стъпка по стъпка се справя забележимо по-добре и след това е в състояние да изпълни задачата самостоятелно. Това показва възможността за „учене чрез езика“ – подход, при който инструкциите се превръщат в инструмент за програмиране на поведението.
Моделът е способен да прехвърля умения между различните роботи. В един тест π 0,7 управлява с две ръце индустриалната система UR5e, докато сгъва дрехи, въпреки че такива данни не са използвани при обучението. Представянето на модела беше на нивото на професионални оператори, които току-що са започнали да работят с тази машина.
Публикуването на проучването стана факт след съобщенията на Bloomberg за плановете на Physical Intelligence да набере около 1 млрд. долара. Очаква се оценката на компанията да надхвърли 11 млрд. долара в края на кръга – почти два пъти повече от предишната стойност от 5,6 млрд. долара, регистрирана при набирането на 600 млн. долара само преди няколко месеца.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!