ИИ се научи да говори като човек. И вече заменя екскурзоводите, операторите и лекарите

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Машините се научават да говорят все по-изразително.

Изследванията в областта на изкуствения интелект продължават да постигат бърз напредък, а едно от най-впечатляващите постижения е системата J-Moshi, създадена в Япония. Моделът е първият по рода си, създаден специално за улавяне на особеностите на японската разговорна реч – включително такива важни елементи като „aizuchi“, кратки реплики като „Sou desu ne“ (правилно) и „Naruhodo“ (разбираемо), с които японците показват, че слушат внимателно събеседника. Именно умението да се вмъкват навреме такива реплики прави разговора жив и естествен.

Конвенционалните системи за изкуствен интелект не могат да се справят с такава задача, тъй като не могат да слушат и говорят едновременно. J-Moshi успява да преодолее това ограничение, което прави системата особено привлекателна за говорещите на роден език. Потребителите отбелязват, че разговорът с него е почти като разговор с жив човек.

J-Moshi е създадена от специалисти от университета в Нагоя. Проектът е базиран на англоезичния модел Moshi, разработен в Kyutai, а адаптирането му към японския език отнема около четири месеца. В процеса са използвани обширни набори от речеви данни, сред които се откроява J-CHAT – най-голямата отворена база данни с японски диалози, създадена от Токийския университет. Тя съдържа около 67 000 часа подкастове и клипове в YouTube. Кодовата база, използвана за обучението на J-Moshi, е достъпна в GitHub.

За да направят системата по-точна и разнообразна, разработчиците са добавили към обучението остарели, но висококачествени диалогови бази, както и данни, генерирани от преобразуването на текст в реч от чатове. По този начин се компенсира хроничният недостиг на данни за японската реч, който остава сериозна пречка за развитието на ИИ в страната.

J-Moshi стана особено известен през януари 2024 г., когато демонстрационни видеоклипове с него се разпространиха в социалните мрежи. Освен интерес от страна на лингвистите и ентусиастите, системата предизвика вълнение и сред изучаващите японски език – защото сега е възможно да се упражняват уменията за общуване с „естествен“ събеседник.

Освен в сферата на образованието се разработват и търговски сценарии – от кол центрове до медицината и обслужването на клиенти. Системата J-Moshi вече се използва в говорещите роботи на обществени места за провеждане на стандартни диалози, а в случай на сложни въпроси те могат бързо да свържат потребителя с оператор в реално време.

ИИ се научи да говори като човек. И вече заменя екскурзоводите, операторите и лекарите
Говорещият робот със системата J-Moshi

Въпреки това внедряването на J-Moshi в тясно специализирани отрасли е възпрепятствано от факта, че японската реч в тези области е слабо документирана и почти не е дигитализирана. В допълнение към липсата на данни за речта, японските разработчици са затруднени и от проблемите, свързани с неприкосновеността на личния живот, които затрудняват събирането на подходящи аудио данни. Някои решения включват софтуерно разделяне на гласовете в записи, в които няколко души говорят едновременно.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини