Google представи новото семейство генеративни AI модели Gemini Omni, предназначено за създаване на съдържание от всякакъв вид входни данни. Първият продукт от тази серия се нарича Gemini Omni Flash – той е способен да генерира видеоклипове въз основа на текст, снимки, аудио или други видеозаписи. Алгоритъмът съчетава мултимодални възможности с дълбоко разбиране на законите на физиката и реалния свят.
Ключовата разлика между Gemini Omni Flash и съществуващия модел Veo, както пише Google в своя блог, е функцията за преобразуване на едно видео в друго. Алгоритъмът не просто генерира визуална поредица, но и позволява редактиране на изходните кадри с помощта на естествен език в диалогов формат, запазвайки логиката на сцената и последователността на действията на героите при всякa нова заявка. Както отбелязва старшия директорът по изследванията в Google DeepMind Думитру Ерхан, в момента системата може да създава клипове със звук с продължителност до 10 секунди, но компанията вече работи по увеличаването на този лимит.
AI моделът се основава на обширната база от знания на екосистемата Gemini, което му позволява да създава сцени, отчитащи историческия и научния контекст, както и да възпроизвежда точно гравитацията или динамиката на течностите. Техническият директор на Google DeepMind и главен архитект по изкуствен интелект в Google Корай Кавукчуоглу подчерта, че новата технология разполага с много по-голяма информация за устройството на света, отколкото предишните разработки. Потребителите също така ще получат възможност да генерират свой собствен цифров аватар и да му придадат своя глас. Ръководителката на екипа разработчици на продукта Никол Брихтова посочи, че подобна функция за интегриране на собствения външен вид е била изключително търсена в миналогодишния модел за генериране на изображения Nano Banana, с помощта на който са създадени над 50 милиарда изображения.
От съображения за сигурност корпорацията засега ограничава алгоритъма във възможността да променя чужда реч във видеоклипове, а всички генерирани клипове автоматично се маркират с невидим цифров воден знак SynthID за проверка на автентичността на съдържанието. В бъдеще разработчиците планират да добавят поддръжка за извеждане на аудио и статични изображения. Gemini Omni Flash вече е достъпен в световен мащаб за абонатите на плановете Google AI Plus, Pro и Ultra чрез приложението Gemini и услугата Google Flow.
От тази седмица безплатен достъп до генератора се отваря и за потребителите в приложенията YouTube Shorts и YouTube Create App.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!