Невронна мрежа прочита 46,8% от думите по устните на човека, а експертите едва 12,4%

0
74
Досега бяха създавани подобни невронни мрежи, като например LipNet, които могат да четат по устните на човека само ограничен брой думи –  LipNet може да съставя едва 33 000 изречения. Сега специалистите от Оксфордския университет заедно с екипа на невронната мрежа Google DeepMind създадоха нов ИИ, който може да чете по устните на хората в телевизионните предавания.

google-deepmind-1

Новата невронна мрежа е тренирана с произволни текстове от телевизионните предавания на английската BBC. Интересно е, че тренировката е извършена автоматично от ИИ, без да се налага ръчно анотиране на речта. Системата сама е разпознавала речта, анотирала е видеото, намирала е лицата в кадъра, а след това се е научила да определя връзката между звуците в думите и движението на устните.

Най-новият вариант на този ИИ с голяма точност разпознава произволни текстове и изречения, а не екземпляри от речник, съдържащ изречения и най-различни изрази. За нормалната работа на тази невронна мрежа е достатъчно стандартното телевизионно качество.

ИИ е обучен с помощта на 5000 часа видео, записано от шест телевизионни предавания на BBC от месец ноември 2010 година до декември 2015: новини (1584 часа), сутрешни новини (1997 часа), предаванията Newsnight (590 часа), World News (194 часа), Question Time (323 часа) и World Today (272 часа). Това са 118 116 изречения слята човешка реч.

След това изкуственият интелект е проверен с помощта на телевизионните предавания от март до септември тази година.

Новият ИИ показа значително по-добра работа от експерта по четене на думи по устните. Професионалистът е успял да разпознае едва 12,4% от думите, докато ИИ коректно е разпознал 46,8%. Но някои грешки са съвсем незначителни – например „s“ в края на думата. Ако тези грешки се пренебрегнат, резултатът надвишава половината от думите от екрана.

google-deepmind-2

Според специалистите, Google DeepMind е голяма стъпка напред в създаването на изцяло автоматична система за прочитане на думите и изразите по устните на човека.

Новият ИИ има и недостатък – и при най-малко разсинхронизиране на звука и образа с движението на устните, което се случва и в британската телевизия, системата става безполезна. Но върху този проблем се работи, а DeepMind обеща, че ще публикува цялата информация с открит достъп.

Новата система би могла да се вгради в съвременните телевизори и в битовите уреди за безпогрешно разпознаване на речта.

Научната работа е достъпна за всички в сайта arXiv (arXiv:1611.05358v1).

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!