Китай срещу Силициевата долина. Създателите на Video O1 твърдят, че тяхната невронна мрежа превъзхожда решенията на Google и Runway

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Сложното редактиране на видео вече не изисква нито опит, нито дълги часове работа.

Надпреварата за лидерство на пазара за генериране на видео с изкуствен интелект продължава, тъй като китайската компания Kling AI представи „Video O1“, който съчетава създаването и редактирането на видео в едно решение. Играчи като Google, OpenAI, Runway и други все по-активно създават нови възможности и новият продукт на Kling се вписва идеално в тази конкуренция.

Според Kling AI „Video O1“ е замислен като единна мултимодална система, която се справя със задачи, за които преди е трябвало да се използват различни инструменти. Моделът създава три- до десетсекундни клипове от текстово описание или примерна снимка, както и модифицира съществуващи видеоклипове – от промяна на главния герой и времето до коригиране на стила и цветовата схема. Няколко промени могат да се приложат с една заявка: можете едновременно да зададете нов герой, да промените фона и цялостния визуален стил на сцената.

Системата обработва няколко вида входни данни едновременно, като интерпретира до седем изображения, видеоклипове, обекти и текстови низове като подсказки. Управлението се основава на общи текстови команди – например премахването на минувачи от кадъра или преобразуването на сцената от дневна светлина в здрач се извършва без ръчно избиране на маски или анимация кадър по кадър. Потребителските герои, реквизит и сцени се зареждат отделно и след това могат да се използват в различни клипове. Клинг казва, че моделът разбира достатъчно добре входните данни, за да поддържа целостта на обектите, хората и стоките при промяна на плановете и ъглите.

В основата на Video O1 е архитектурата на мултимодалния трансформър. Компанията описва собствения си формат „Multimodal Visual Language“ (MVL), който действа като мост между текста и визуалните сигнали. Освен това тя твърди, че използва вериги от разсъждения, за да изведе събитията в кадъра, така че генерирането на клиповете да разчита не само на статистическите съвпадения. По отношение на терминологията си Kling отчасти повтаря формулировката, която Google прилага към последните модели

. При проведените вътрешни тестове Kling AI сравнява „Video O1“ с Google Veo 3.1 и Runway Aleph. В задачи, в които клиповете се създават от образцово изображение, китайският модел, според твърденията на компанията, се е представил забележимо по-добре от функцията „ingredients to video“ на Google. При конвертиране на съществуващи клипове оценителите са били по-склонни да изберат Video O1, отколкото решението на Runway Aleph. Всички данни обаче се основават на затворени тестове на самата компания Kling и все още не са потвърдени от независими сравнения.

Достъпът до „Video O1“ вече е наличен чрез уеб интерфейса на Kling AI. На пазара за генериране на видео с изкуствен интелект моделът се сблъсква със силна конкуренция: почти едновременно Runway представи „Gen-4.5“ като най-мощното си решение до момента, а сред конкурентите са Google, OpenAI, Midjourney и китайските компании Hailuo, Seedance и Vidu, които разчитат на намаляване на цената на подобни услуги.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини