Amazon представи новия гласов модел Nova Sonic: той е по-точен от GPT-4o

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Amazon официално представи на света своя нов модел на генеративен изкуствен интелект, който се нарича Nova Sonic и който може да обработва гласа на потребителя, както и да генерира естествена реч въз основа на текстови указания. Представителите на компанията отбелязват, че по отношение на производителността новият им модел е в състояние да се конкурира с най-новите гласови модели на OpenAI и Google в сравнителните тестове, които оценяват скоростта, точността на разпознаване на човешката реч и качеството на генерирания диалог. Като се има предвид, че тези компании са лидери на пазара, това е наистина впечатляващ напредък.

Освен това в официално прессъобщение Amazon определя Nova Sonic като най-рентабилния модел на изкуствен интелект за обработка на глас, като посочва, че новият продукт е с около 80% по-евтин от модела GPT-4o на OpenAI. В периода на бум на изкуствения интелект, когато се налага да се изразходват безумни ресурси за разработване на нови технологии, разширяване на инфраструктурата и енергия, по-рентабилният модел е ключов приоритет за големите компании и техните потребители. Amazon също така разкри, че Nova Sonic е изграден върху техническата архитектура, която е в основата на гласовия асистент Alexa.

Amazon представи новия гласов модел Nova Sonic: той е по-точен от GPT-4o

Разработчиците отбелязват, че новият гласов модел отлично се справя с маршрутизирането на потребителските заявки към различните API, което прави Nova Sonic много по-практично решение. Така например гласовият модел разбира кога трябва да намери информация в реално време от интернет, да анализира собствените си източници на информация или да извърши необходимите действия във външно приложение, използвайки подходящ инструмент. Също така моделът в рамките на двустранен диалог знае как да изчака, за да говори с дадено лице в най-подходящия момент, като взема предвид паузите в речта.

Но най-важното е, че Nova Sonic допуска много по-малко грешки при разпознаване на речта в сравнение с другите гласови ИИ модели. Например, той може точно да разбира фразите на потребителя, дори ако той мърмори, прави грешки в думите или се намира в шумна среда.

В многоезичния тест за разпознаване на реч LibriSpeech гласовият ИИ модел на Amazon демонстрира среден процент на грешките от 4,2% (само 4 от 100 думи се разпознават с грешка). А в теста Augmented Multi Party Interaction (Разширено взаимодействие между няколко страни) решението на компанията е с 46,7% по-точно от GPT-4o-transcribe на OpenAI. ИИ Nova Sonic превъзхожда конкурента си и по отношение на скоростта – средната латентност на модела е 1,09 секунди, докато GPT-4o показва 1,18 секунди.

Наистина много добро постижение на Amazon, което има потенциала да промени много неща в ИИ сферата.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини