Google представи Gemini Omni – AI за генериране на видео от текст, снимки, аудио и всякакви други данни

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Google представи новото семейство генеративни AI модели Gemini Omni, предназначено за създаване на съдържание от всякакъв вид входни данни. Първият продукт от тази серия се нарича Gemini Omni Flash – той е способен да генерира видеоклипове въз основа на текст, снимки, аудио или други видеозаписи. Алгоритъмът съчетава мултимодални възможности с дълбоко разбиране на законите на физиката и реалния свят.

Ключовата разлика между Gemini Omni Flash и съществуващия модел Veo, както пише Google в своя блог, е функцията за преобразуване на едно видео в друго. Алгоритъмът не просто генерира визуална поредица, но и позволява редактиране на изходните кадри с помощта на естествен език в диалогов формат, запазвайки логиката на сцената и последователността на действията на героите при всякa нова заявка. Както отбелязва старшия директорът по изследванията в Google DeepMind Думитру Ерхан, в момента системата може да създава клипове със звук с продължителност до 10 секунди, но компанията вече работи по увеличаването на този лимит.

Заявка: Генерирай скулптура от мехурчета

AI моделът се основава на обширната база от знания на екосистемата Gemini, което му позволява да създава сцени, отчитащи историческия и научния контекст, както и да възпроизвежда точно гравитацията или динамиката на течностите. Техническият директор на Google DeepMind и главен архитект по изкуствен интелект в Google Корай Кавукчуоглу подчерта, че новата технология разполага с много по-голяма информация за устройството на света, отколкото предишните разработки. Потребителите също така ще получат възможност да генерират свой собствен цифров аватар и да му придадат своя глас. Ръководителката на екипа разработчици на продукта Никол Брихтова посочи, че подобна функция за интегриране на собствения външен вид е била изключително търсена в миналогодишния модел за генериране на изображения Nano Banana, с помощта на който са създадени над 50 милиарда изображения.

Заявка: Динамично видео в стила на научнофантастичен филм, базирано на image_0.png. Елементите да светят по подобие на video_0.mp4, синхронизирани с ритъма на музиката от audio_0.wav

От съображения за сигурност корпорацията засега ограничава алгоритъма във възможността да променя чужда реч във видеоклипове, а всички генерирани клипове автоматично се маркират с невидим цифров воден знак SynthID за проверка на автентичността на съдържанието. В бъдеще разработчиците планират да добавят поддръжка за извеждане на аудио и статични изображения. Gemini Omni Flash вече е достъпен в световен мащаб за абонатите на плановете Google AI Plus, Pro и Ultra чрез приложението Gemini и услугата Google Flow.

От тази седмица безплатен достъп до генератора се отваря и за потребителите в приложенията YouTube Shorts и YouTube Create App.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Абонирай се
Извести ме за
guest

0 Коментара
стари
нови оценка

Нови ревюта

Подобни новини