За да се концентрираме върху думите на един човек на фона на разговорите на много хора, не се изискват почти никакви усилия. Но досега за машините това бе невъзможно.
По време на събитието R&D Open House в Токио японската компания Mitsubishi Electric представи нова технология за разпознаване на човешка реч. ИИ успешно разделя и разпознава гласовете на един от двама души, едновременно говорещи в един и същ микрофон, но на различни езици. Разпознаването става почти в реално време, като максималното закъснение е 3 секунди. Точността на разпознаване е 90%, а когато трима души заговорят едновременно, точността пада до 80%.
Високата точност е постигната с използването на разновидност на Deep Clustering. Невронната мрежа разделя речта на малки частици, а специален алгоритъм избира елементите с общи черти.
Важно достойнство на на новата система за разпознаване на човешка реч е, че не се налага предварително обучение или каквато и да е предварителна настройка за работа с гласа на определен човек и работи със всякакви гласове без предварителна подготовка. Точността на работа не зависи от езика, на който се говори. „Новата технология ще използваме в места, където е необходима висока точност на разпознаване, като например управлението на новите автомобили, в асансьорите, битовите прибори и други електронни устройства“ – каза Йохеи Окато (Yohei Okato), представител на Mitsubishi Electric.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

















