Google започна да разпространява Gemini 3.1 Flash Live – нов AI модел за диалози в реално време. Според компанията системата генерира речта по-бързо и с по-естествен ритъм, справя се по-добре със сложни гласови сценарии и вече е налична както в услугите на Google, така и в инструментите за разработчици. Това ще направи още по-трудно разпознаването на синтезирана реч по слух.
Новият AI модел е предназначен да намали латентността и да увеличи естествеността на синтезираната реч. Голямото закъснение между входящия сигнал и отговора, както и неестествената интонация, правят диалога бавен и труден за възприемане от хората. Изследователите обикновено смятат, че границата на оптималното възприемане на речта е около 300 милисекунди, но конкретното закъснение на Gemini 3.1 Flash Live Google не разкрива.
Вместо това компанията се позовава на резултатите от тестовете. Подобрението в ComplexFuncBench Audio показва по-уверено справяне със сложните многоетапни задачи. В Big Bench Audio AI моделът също заема водеща позиция. Този тест оценява способността за разсъждение върху набор от 1000 аудио въпроса.
Отделно се отбелязва и резултатът в теста Scale AI’s Audio MultiChallenge, който оценява устойчивостта на AI към паузите, колебанията и прекъсванията във входящия аудиопоток. Въпреки че Gemini 3.1 Flash Live превъзхожда другите AI модели за обработка на аудио в реално време, той получи само 36,1% от точките в този тест. AI моделите, които не са проектирани за обработка на диалог, могат да постигнат над 50% резултат в теста MultiChallenge.
Според технологичния гигант Google новият Gemini 3.1 Flash Live звучи по-близо до човешката реч, затова в аудиоизхода са вградени водните знаци SynthID. Те не се възприемат от ухото, но ви позволяват технически да определите, че речта е генерирана от изкуствен интелект, ако се опитат да я представят за истинска.
Нововъведението е тествано с Home Depot, Verizon и други компании. В публикацията на Google партньорите хвалят способността на Gemini 3.1 Flash Live да имитира човешката реч, така че следващият AI асистент в един телефонен разговор може да звучи много по-реалистично, а човекът, с когото говорите, може и да го приеме за човек. Gemini 3.1 Flash Live показва, че тъй като синтезираната реч става по-бърза, по-плавна и по-естествена, ще става все по-трудно да се прави разлика между човека и изкуствения интелект в гласовата комуникация.
Технологията е оптимизирана да работи с минимални изчислителни ресурси, което позволява нейното внедряване директно в смартфоните и носимите устройства. Това я прави идеална за лични асистенти от ново поколение, които ще стават все по-неразделна част от нашето ежедневие.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!