Във вторник, 2 септември, Tencent представи новия ИИ-модел HunyuanWorld-Voyager, който може да създава последователни 3D-видеоклипове от едно изображение.
Потребителите могат също да контролират камерата, за да изследват генерираните светове. Моделът едновременно генерира RGB-видео и информация за дълбочината, което позволява директно модифициране на детайлите без нужда от традиционни инструменти за моделиране.
Не очаквайте обаче HunyuanWorld-Voyager скоро да се превърне в пълноценна алтернатива на традиционните видеоигри. Генерираните резултати не са реални 3D-модели, но постигат подобен ефект.
По-конкретно, изкуственият интелект генерира 2D-видеокадри, които поддържат пространствена консистентност, сякаш камерата действително се движи в 3D пространство. Всяко генериране произвежда 49 кадъра, всеки с продължителност около 2 секунди.
Представители на Tencent отбелязват, че множество видеоклипове могат да бъдат комбинирани последователно заедно за обща продължителност от няколко минути. Обектите остават в една и съща относителна позиция, докато камерата се движи около тях, а перспективата се променя правилно, както се очаква в реална 3D среда.
Крайният резултат е видео с карти на дълбочината, а не истински 3D-модели, но могат да се преобразуват в трийзмерни облаци от точки за реконструкция. На входа системата приема от потребителя едно изображение и зададена траектория на движение на камерата.
Потребителите могат да избират как да се движи камерата — напред-назад, наляво-надясно или да се завърта, използвайки интерфейса. HunyuanWorld-Voyager комбинира данни за изображението и дълбочината с „глобален кеш“, за да създава последователни видеоклипове, които показват избраното от потребителя движение на камерата.
Ключово ограничение на всички AI-модели, базирани на архитектурата Transformer, е, че те по същество имитират моделите, открити в обучителните набори от данни, което ограничава способността им да използват тези модели в нови контексти, които не са били налични в обучителния набор от данни.
За да обучат HunyuanWorld-Voyager, разработчиците са използвали над 100 000 видеоклипа, включително сцени, генерирани с помощта на Unreal Engine. По този начин моделът се е научил да имитира движението на камерата в 3D игрова среда.
Повечето видео генератори, базирани на изкуствен интелект, като Sora, генерират кадри последователно, без да проследяват или поддържат пространствена кохерентност. Междувременно HunyuanWorld-Voyager е обучен да разпознава и възпроизвежда моделите на пространствена кохерентност, но с добавяне на геометрична обратна връзка.
Докато системата генерира всеки кадър, тя трансформира входните данни в 3D точки, след което проектира тези точки обратно в 2D за използване в бъдещи кадри. Този метод принуждава модела да съпоставя научените шаблони с геометрично съвместими проекции на собствените си предишни входни данни. Въпреки че това осигурява значително по-добра пространствена съвместимост от традиционните видео генератори, то все още представлява съпоставяне на шаблони, базирано на геометрични ограничения, а не реално моделиране в 3D среда.
Това обяснява защо моделът може да поддържа последователност в продължение на няколко минути, но се затруднява, когато камерата се завърти напълно на 360°. Кадър след кадър, малки грешки се натрупват в резултат на съвпадението на шаблоните, докато геометричните ограничения вече не загубят пространствената си последователност.

Процесът по създаване на свят в HunyuanWorld-Voyager/Tencent
Техническият доклад на Tencent отбелязва, че системата използва две ключови части, които работят заедно. HunyuanWorld-Voyager едновременно генерира цветно видео и информация за дълбочината. Така че, ако например във видеото има дърво, информацията за дълбочината точно определя колко далеч е дървото. Второ, моделът използва това, което Tencent нарича „глобален кеш“ – нарастваща колекция от 3D точки, създадени от генерирани преди това кадри.
С генерирането на нови кадри, този облак от точки се проектира обратно в 2D от новия ъгъл на камерата, за да се създадат частични изображения, показващи какво би трябвало да се вижда въз основа на предишните кадри. HunyuanWorld-Voyager след това използва тези кадри, за да провери пространствената съгласуваност и да гарантира, че новите кадри съответстват на генерираните преди това.
HunyuanWorld-Voyager се присъединява към колекцията от видео генератори, задвижвани от изкуствен интелект, която включва и Genie 3, който Google обяви през август тази година. Твърди се, че този модел, чрез текстови подкани, генерира интерактивни светове с резолюция 720p и 24 кадъра в секунда.
Междувременно, Mirage 2 на Dynamics Lab предлага генериране на светове в браузъра, което позволява на потребителите с текстови подкани в реално време да качват изображения и да ги превръщат в игрови среди. HunyuanWorld-Voyager е насочен предимно към видео продукцията и работните процеси за 3D реконструкция, с възможност за извеждане на RGB дълбочина.
HunyuanWorld-Voyager представлява усъвършенстван вариант на по-ранната версия HunyuanWorld 1.0, пусната през юли тази година. Тя е част и от по-широката система „Hunyuan“ на Tencent, която включва модела Hunyuan3D-2 за генериране на 3D модели от текст и HunyuanVideo за генериране на видеоклипове.
За да обучават HunyuanWorld-Voyager, разработчиците са създали софтуер, който автоматично анализира съществуващи видеоклипове, обработва движенията на камерата и изчислява дълбочината за всеки кадър. Системата обработва повече от 100 000 видеоклипа от реални записи и рендери на Unreal Engine.
Този модел изисква значителна процесорна мощност: поне 60GB VRAM при 540p, въпреки че Tencent препоръчва 80GB VRAM за оптимални резултати. Tencent публикува коефициентите на тегло на модела в Hugging Face и включи код, който работи както с единични, така и с множество графични процесори.
Този модел обаче има значителни лицензионни ограничения. Заедно с други модели на Hunyuan, World-Voyager не е достъпен за потребителите в ЕС, Великобритания и Южна Корея. Освен това, търговската употреба с над 100 милиона активни потребители месечно изисква отделно лицензиране от Tencent.
Според бенчмарка WorldScore, разработеният от изследователи от Станфорд, Voyager е получил най-висок общ резултат от 77,62, докато WonderWorld е получил 72,69, а CogVideoX-I2V — 62,15. Моделът се е отличил в обработката на обекти (66,92), стиловата последователност (84,89) и субективното качество (71,09), въпреки че е заел второ място в обработката на камерата (85,95), след 92,98 на WonderWorld.
Въпреки че тези резултати от бенчмарк тестовете, както са докладвани от самите разработчици, изглеждат обещаващи, по-широкото им използване все още е изправено пред предизвикателства поради високата процесорна мощност. За разработчиците, които се нуждаят от по-бърза обработка на данни, системата поддържа паралелен извод между множество графични процесори, използвайки фреймуърка xDiT.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!