Специалистите от лабораторията по информатика и изкуствен интелект (CSAIL) на Масачузетския технологичен институт заедно с отдел на Google Research създадоха невронна мрежа, която озвучава произволен видеоклип, който няма аудио. Програмата анализира видеото, разпознава обектите в него, тяхното движение и съприкосновение – удари, триене и т.н. Въз основа на тази информация невронната мрежа генерира дотолкова качествен и правдоподобен звук, че в 40% от случаите хората го приемат за истински и достоверен.
Учените са подбрали 997 клипа, в които има най-различни взаимодействия между различни среди, предмети и материали. Клиповете съдържат 46 577 действия – удари, драскане, плъзгане и други. Специалистите самостоятелно са започнали да регистрират типа на материала, мястото на допир, реакциите на обектите. Тези клипове се оказали достатъчни за обучението на невронната мрежа, а поставените ръчно маркери са се използвали за анализ на работата на невронната мрежа, а не за нейното обучение.
При обучението изкуственият интелект от начално ниво изучавал клиповете кадър по кадър и анализирала звука в него, като по този начин е създал собствена база данни за съответствията между действие и звук. С всеки нов клип точността на генерирания звук се повишава.
Околните звуци дават обилна информация за околните обекти, за техния строеж и конструкция. Новата технология може да се използва при създаване на нови ефекти в киното и за по-добро обучение на роботите от ново поколение.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!