Google обяви разработването на Imagen Video – изкуствен интелект за преобразуване на текст във видео. Той може да създава видеоклипове с резолюция 1280 × 768 пиксела при 24 кадъра в секунда – от писмено задание.
Понастоящем той е във фаза на изследване, но появата му пет месеца след Google Imagen сочи бързото развитие на моделите за видеосинтез.
Съобщението на Google за Imagen Video идва по-малко от седмица, след като Meta представи своя инструмент за изкуствен интелект за преобразуване на текст във видео – Make-A-Video.
Според изследователския документ на Google, Imagen Video включва няколко забележителни стилистични способности.
Като например генериране на видеоклипове, базирани на творчеството на известни художници (например картините на Винсент ван Гог), генериране на 3D въртящи се обекти при запазване на структурата на обекта и визуализиране на текст в различни анимационни стилове.
Google се надява, че моделите за видеосинтез с общо предназначение могат „значително да намалят трудността при генерирането на висококачествено съдържание“.
Ключът към способностите на Imagen Video е каскада от седем дифузионни модела, които трансформират първоначалната текстова подсказка – например „мечка мие чиниите“.
Първо се създава видео с ниска резолюция от 24х48 пиксела, при скорост на възпроизвеждане от 3 кадъра в секунда и общо 16 кадъра. След това разделителната способност се увеличава постепенно, заедно с честотата на кадрите при всяка стъпка.
Крайният изходен видеоклип е с дължина 5,3 секунди.
Представените на уебсайта на Imagen Video примери за видеоклипове варират от обикновени („Разтапящ се сладолед, който капе по фунийката“) до по-фантастични („Прелитане през интензивна битка между пиратски кораби в бурен океан.“)
Те съдържат очевидни артефакти, но показват повече плавност и детайлност от по-ранните модели за преобразуване, като например CogVideo, който дебютира преди пет месеца.
Данните за обучение на Google Imagen Video идват от публично достъпния набор от данни за изображения и текст LAION-400M. Добавени са и „14 милиона двойки видео-текст, както и 60 милиона двойки изображения-текст“, според Google.
В резултат на това системата е обучена върху данни, които могат да съдържат нецензурно съдържание от различен тип.
Данни, които могат да насочат ИИ към стереотипи и предразсъдъци. Фирмата също така се опасява, че нейният инструмент може да бъде използван за генериране на фалшиво и вредно съдържание.
В резултат на това е малко вероятно скоро да видим публична версия:
Решихме да не публикуваме модела Imagen Video или неговия изходен код, докато тези опасения не бъдат смекчени
Google
Друг модел за преобразуване на текст във видео, свързан с Google, също бе представен. Наречен е Phenaki и може да създава по-дълги видеоклипове от подробни подсказки.
Това, заедно с DreamFusion, който може да създава 3D модели от текстови подсказки, показва, че прогресът е значителен.
DreamFusion е разработка на Google и Университета в Бъркли. Заедно са създали невронна мрежа за визуализация, задвижвана от ИИ, която може да синтезира 3D обекти от текст. Моделът получава името Dream Fields и може да генерира геометрията и цвета на широк кръг обекти. Съществуващите методи генерират обекти само от няколко категории.
Dream Fields обаче е обучен върху голям набор от данни с изображения и надписи от интернет.
Този метод оптимизира невронното поле на излъчване от множество изгледи на камерата, така че визуализираните изображения да отговарят точно на целевия надпис – според предварително обучен CLIP модел. За да увеличат максимално верността и визуалното качество, изследователите въвеждат прости геометрични прийоми. Това включва индуцираща рядкост регуларизация на пропускането, граници на сцената и нови MLP архитектури. В крайна сметка се получават реалистична, последователна геометрия и цвят на обектите с множество изгледи.
Вижте го в действие:
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!


