Китайската компания Xiaomi, известна предимно като производител на мобилни устройства, интелигентно домашно оборудване, а от скоро и на електромобили се изявява в ново сфера. Компанията сега е решила да си намери място в областта на изследванията на роботиката.
Компанията представи Xiaomi-Robotics-0 – AI модел с отворен код, който съчетава визуални, езикови и компоненти на действие. Той има 4,7 млрд. параметъра.
AI моделът съчетава разпознаване на визуални модели, разбиране на езика и способност за създаване на действия в реално време, което, както отбеляза Xiaomi, е в основата на „физическия интелект“. Той вече е поставил няколко рекорда както при симулации, така и при тестове в реални условия.
AI моделите за роботи обикновено работят в затворен цикъл: възприемане, вземане на решение и изпълнение на операция. Роботът вижда обекти в околната среда, разбира какво се изисква от него, прави план за действие и го изпълнява. Xiaomi-Robotics-0 е създаден, за да балансира широкото разбиране с прецизния контрол. За да постигне това, той използва архитектура Mixture-of-Transformers (MoT), която помага за разпределяне на отговорностите между два основни компонента.

Първият компонент е Visual-Language Model (VLM), който действа като „мозък“. Той е обучен да интерпретира команди, дадени от хора, включително неясни команди като „моля, сгънете кърпата“, и да разбира пространствени взаимоотношения въз основа на визуални сигнали с висока резолюция. Задачите на тази част са откриване на обекти, отговаряне на въпроси във визуалната област и логическо разсъждение. Вторият компонент се нарича Action Expert. Тази част от модела има архитектура Diffusion Transformer — DiT. Тя не предполага по едно действие в даден момент, а генерира последователност от действия, използвайки техники за съвпадение на потоците, което осигурява точност и плавност на движението.
Слабостта на VLM е, че когато са обучени да изпълняват физически операции, те са склонни да загубят някои от предишните си способности за разбиране. Инженерите на Xiaomi са успели да избегнат този проблем, като са обучили модела едновременно на мултимодални данни и данни за действия. На теория това означава, че такава система може едновременно да разсъждава за обектите от заобикалящия свят и да се научи да се движи в него. Процесът на обучение включва няколко етапа. Първо, механизмът „предложение за действие“ кара VLM да предвижда възможните разпределения на действията при интерпретиране на изображенията – това помага да се съгласува вътрешното представяне на модела за това, което вижда, с начина на извършване на операциите. След това компонентът VLM се спира и DiT се обучава отделно да генерира точни последователности от шума въз основа на ключови характеристики, а не на дискретни езикови токени.

Xiaomi успява да реши проблема с латентността на изхода – паузата между прогнозите, изготвени от модела и физическото движение на робота. За тази цел те са реализирали асинхронно извеждане, като са разделили изчисленията на модела от действията на робота: движенията остават непрекъснати, дори ако моделът се нуждае от допълнително време за размисъл. За повишаване на стабилността е използвана техниката Clean Action Prefix, която включва връщане на предварително предсказано действие към модела, осигурявайки плавно движение без тласъци във времето. Маската за внимание насочва модела към текущата визуална последователност, като понижава приоритета на минали състояния, в резултат на което се получава робот, който реагира на внезапни промени в околната среда.
При симулации, проведени от LIBERO, CALVIN и SimplerEnv, AI моделът Xiaomi-Robotics-0 превъзхожда около 30 други, казва разработчикът. В реални експерименти той е тестван върху робот с две ръце: при задачи с последователност от действия, като сгъване на кърпи и разглобяване на строителни блокчета, роботът показва стабилна координация между ръцете и очите, като манипулира еднакво ефективно както твърди, така и меки предмети. Моделът успя да запази силни визуални и езикови способности, особено при задачи, включващи физическо взаимодействие.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!