Идеята за универсален „мозък“ за роботи вече не е само изследователска цел. Google DeepMind се опитва да създаде интелект, който запазва уменията при преминаване между различни корпуси, ръце и задвижвания. В Gemini Robotics 2 компанията вече използва един и същ контролен отпечатък на AI модела за няколко робота, а локалната версия се адаптира към новото тяло за няколко часа.
Google DeepMind представи Gemini Robotics 2 в края на юли. Системата управлява цялото тяло на хуманоида Apptronik Apollo 2, включително краката, корпуса, ръцете и пръстите, а същият контролен шаблон работи на две конфигурации на Apollo и на двуръката платформа Franka Duo. Основният акцент е поставен върху пренасянето на умения между различна механика.
Под названието „мозък“ се крие повече от една невронна мрежа, която може буквално да се адаптира без настройка. Gemini Robotics 2 преобразува изображението и текстовата команда в движения, Gemini Robotics ER 2 планира многоетапна работа и следи нейния ход, а Gemini Robotics On-Device 2 осъществява управлението локално. DeepMind обучава последния модел да се приспособява бързо към нов корпус.
За новата двуръка платформа Gemini Robotics On-Device 2 обикновено са достатъчни по-малко от 200 примера и няколко часа допълнително обучение. DeepMind е тествала този трансфер върху Dexmate, SO101 и Trossen, които се различават по форма, сензори и брой степени на свобода. Този подход намалява обема на данните, които преди се налагаше да се събират поотделно за всяка конструкция.
Пренасянето между корпусите не е показател за човешка сръчност. В тестовете Apollo 2 с многопръстна ръка отвиваше крушката в 92% от опитите, но я завиваше само в 36%, а работата с лопата се получаваше в 32% от случаите. С обичайния двупръстов захват Franka Duo се справяше по-добре: точността при поставянето на детайли достигна 89,6%, а при окомплектоването на инструменти – 78,9%. Дори сходните умения се различават значително.
Подобна разлика се забелязва и при движенията на цялото тяло. Apollo 2 успешно вземаше предмет от рафта в 76,3% от тестовете, от масата – в 68,4%, а от пода – само в 45,7%. DeepMind директно признава, че скоростта на движенията и манипулациите с много пръсти остават слабо място. Ето защо настоящите резултати описват лабораторни демонстрации, а не готов универсален помощник.
DeepMind изгражда високата част на системата си около „въплътеното разсъждение“, при което AI оценява обстановката, разбива задачата на етапи и променя плана си след грешка. През април Google вече разшири тези възможности в Gemini Robotics-ER 1.6, като добави по-добро пространствено разбиране, работа с няколко камери и проверка на резултата. Новата версия развива същия принцип за по-дълги сценарии.
Gemini Robotics ER 2 вече изпълнява последователности с продължителност от няколко минути и стотици решения, проследява началото и края на етапите и може да координира няколко различни робота. За работа в близост до хора DeepMind добави проверки за безопасност, включително спиране при прекалено близко приближаване на човек и отказ от опасни действия. Засега тези функции се тестват в контролирани условия.
Към 16 септември достъпът остава ограничен. Gemini Robotics ER 2 може да се тества чрез Google AI Studio, а достъпът чрез Gemini Enterprise Agent Platform е в затворен предварителен режим. Основният модел VLA и On-Device 2 се предоставят на партньорите с ранен достъп. Целта на DeepMind е по-широка от конкретния хуманоид: да се отдели интелектът на робота от корпуса и да се направят уменията преносими между машините.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!