Машините се научават да говорят все по-изразително.
Изследванията в областта на изкуствения интелект продължават да постигат бърз напредък, а едно от най-впечатляващите постижения е системата J-Moshi, създадена в Япония. Моделът е първият по рода си, създаден специално за улавяне на особеностите на японската разговорна реч – включително такива важни елементи като „aizuchi“, кратки реплики като „Sou desu ne“ (правилно) и „Naruhodo“ (разбираемо), с които японците показват, че слушат внимателно събеседника. Именно умението да се вмъкват навреме такива реплики прави разговора жив и естествен.
Конвенционалните системи за изкуствен интелект не могат да се справят с такава задача, тъй като не могат да слушат и говорят едновременно. J-Moshi успява да преодолее това ограничение, което прави системата особено привлекателна за говорещите на роден език. Потребителите отбелязват, че разговорът с него е почти като разговор с жив човек.
J-Moshi е създадена от специалисти от университета в Нагоя. Проектът е базиран на англоезичния модел Moshi, разработен в Kyutai, а адаптирането му към японския език отнема около четири месеца. В процеса са използвани обширни набори от речеви данни, сред които се откроява J-CHAT – най-голямата отворена база данни с японски диалози, създадена от Токийския университет. Тя съдържа около 67 000 часа подкастове и клипове в YouTube. Кодовата база, използвана за обучението на J-Moshi, е достъпна в GitHub.
За да направят системата по-точна и разнообразна, разработчиците са добавили към обучението остарели, но висококачествени диалогови бази, както и данни, генерирани от преобразуването на текст в реч от чатове. По този начин се компенсира хроничният недостиг на данни за японската реч, който остава сериозна пречка за развитието на ИИ в страната.
J-Moshi стана особено известен през януари 2024 г., когато демонстрационни видеоклипове с него се разпространиха в социалните мрежи. Освен интерес от страна на лингвистите и ентусиастите, системата предизвика вълнение и сред изучаващите японски език – защото сега е възможно да се упражняват уменията за общуване с „естествен“ събеседник.
Освен в сферата на образованието се разработват и търговски сценарии – от кол центрове до медицината и обслужването на клиенти. Системата J-Moshi вече се използва в говорещите роботи на обществени места за провеждане на стандартни диалози, а в случай на сложни въпроси те могат бързо да свържат потребителя с оператор в реално време.

Въпреки това внедряването на J-Moshi в тясно специализирани отрасли е възпрепятствано от факта, че японската реч в тези области е слабо документирана и почти не е дигитализирана. В допълнение към липсата на данни за речта, японските разработчици са затруднени и от проблемите, свързани с неприкосновеността на личния живот, които затрудняват събирането на подходящи аудио данни. Някои решения включват софтуерно разделяне на гласовете в записи, в които няколко души говорят едновременно.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!