Кино без граници: Подразделение на Alibaba представи ИИ модел за „идеалния“ дублаж на филмите

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Tongyi Lab, компания на Alibaba, пусна Fun-CineForge – първия в света мултимодален модел за озвучаване на филми, чийто изходен код е отворен за изследователи и разработчици. Новата технология има за цел да се справи с предизвикателствата, пред които са изправени традиционните системи с изкуствен интелект за филми и анимация, включително точното синхронизиране на речта с движенията на устните и предаването на сложните емоционални нюанси.

Fun-CineForge преодолява четири ключови бариери във филмовата продукция: синхронизирането на движенията на устните, емоционалното изразяване, последователността на гласа на героите и точното времево подреждане, дори когато говорещият е скрит или отсъства от кадъра. Това дава възможност за озвучаване на сцени, включващи множество герои, без да се губи целостта на диалога.

Моделът използва висококачествения набор от данни CineDub, изграден от над 350 китайски и английски филми и телевизионни сериали. Автоматизираният му процес разчита на метода „влакче на мисълта“, който намалява процента на грешките при транскрипция на китайски и английски текстове до 1-2% и намалява грешките при отделяне на говорещите до 1,2%.

Fun-CineForge използва архитектура за сливане на четири модалности: визуална (форма и изражение на устните), текстова (емоция на диалога), аудио (гласови еталони) и времева, която контролира кога точно да се появи речта и кой герой говори. В резултат на това звукът се синхронизира с изображението дори в сложните сцени, в които лицата не се виждат, което не беше възможно при традиционните модели.

Кино без граници: Подразделение на Alibaba представи ИИ модел за „идеалния“ дублаж на филмите

Експерименталните резултати показват, че моделът превъзхожда базовите системи, като например DeepDubber-V1, по отношение на степента на грешка при разпознаване на думите, точността на синхронизиране на устните и сходството на гласа. Fun-CineForge е първият модел, който поддържа сцени с диалог на двама или повече души, като поддържа постоянен тембър на гласа и точна времева синхронизация.

Той също така работи последователно с видеоклипове с дължина до 30 секунди, като демонстрира стабилно възпроизвеждане и емоционално изразяване. Това открива нови възможности за дублиране на сложни сцени, карикатури и анимационни проекти, при които досега бе трудно да се постигне точно съвпадение на гласа и движението на устните.

Кодът с отворен код на Fun-CineForge позволява на разработчиците да използват модела в свои собствени проекти, да подобряват алгоритмите и да създават по-естествен, емоционално наситен дублаж за филми и анимации, преодолявайки пропастта между синтезираната реч и визуалната част на сцената.

Както при всяка технология за клониране на глас и лице (Deepfake), възникват въпроси относно авторските права. От Alibaba подчертават, че моделът е предназначен за професионална употреба със съгласието на правоносителите и включва невидими цифрови водни знаци за защита срещу фалшификации.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини