Досега бяха създавани подобни невронни мрежи, като например LipNet, които могат да четат по устните на човека само ограничен брой думи – LipNet може да съставя едва 33 000 изречения. Сега специалистите от Оксфордския университет заедно с екипа на невронната мрежа Google DeepMind създадоха нов ИИ, който може да чете по устните на хората в телевизионните предавания.
Новата невронна мрежа е тренирана с произволни текстове от телевизионните предавания на английската BBC. Интересно е, че тренировката е извършена автоматично от ИИ, без да се налага ръчно анотиране на речта. Системата сама е разпознавала речта, анотирала е видеото, намирала е лицата в кадъра, а след това се е научила да определя връзката между звуците в думите и движението на устните.
Най-новият вариант на този ИИ с голяма точност разпознава произволни текстове и изречения, а не екземпляри от речник, съдържащ изречения и най-различни изрази. За нормалната работа на тази невронна мрежа е достатъчно стандартното телевизионно качество.
ИИ е обучен с помощта на 5000 часа видео, записано от шест телевизионни предавания на BBC от месец ноември 2010 година до декември 2015: новини (1584 часа), сутрешни новини (1997 часа), предаванията Newsnight (590 часа), World News (194 часа), Question Time (323 часа) и World Today (272 часа). Това са 118 116 изречения слята човешка реч.
След това изкуственият интелект е проверен с помощта на телевизионните предавания от март до септември тази година.
Новият ИИ показа значително по-добра работа от експерта по четене на думи по устните. Професионалистът е успял да разпознае едва 12,4% от думите, докато ИИ коректно е разпознал 46,8%. Но някои грешки са съвсем незначителни – например „s“ в края на думата. Ако тези грешки се пренебрегнат, резултатът надвишава половината от думите от екрана.
Според специалистите, Google DeepMind е голяма стъпка напред в създаването на изцяло автоматична система за прочитане на думите и изразите по устните на човека.
Новият ИИ има и недостатък – и при най-малко разсинхронизиране на звука и образа с движението на устните, което се случва и в британската телевизия, системата става безполезна. Но върху този проблем се работи, а DeepMind обеща, че ще публикува цялата информация с открит достъп.
Новата система би могла да се вгради в съвременните телевизори и в битовите уреди за безпогрешно разпознаване на речта.
Научната работа е достъпна за всички в сайта arXiv (arXiv:1611.05358v1).
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!


















