OpenAI анонсира голяма актуализация на ChatGPT, която ще позволи на чатбота да вижда изображенията, да чува аудио-файловете и да изговаря генерирания резултат.
ChatGPT can now see, hear, and speak. Rolling out over next two weeks, Plus users will be able to have voice conversations with ChatGPT (iOS & Android) and to include images in conversations (all platforms). https://t.co/uNZjgbR5Bm pic.twitter.com/paG0hMshXb
— OpenAI (@OpenAI) September 25, 2023
Според разработчиците, наличието на глас и изображения ще разшири сценариите на използване на ChatGPT. Например, по време на пътуване, потребителят може да направи снимка на забележителност и да поиска от чатбота допълнителна информация за него. Или можете да помолите асистента да прочете приказка за лека нощ на детето ви.
Как да активирате гласовото въвеждане в ChatGPT?
За да започнете да използвате глас, трябва да отидете в Settings → New Features в мобилното приложение и да изберете voice conversations. След това трябва да докоснете бутона със слушалките, разположен в горния десен ъгъл на главния екран, и да изберете един от петте предложени гласа.
Функцията е базирана на нов модел, който успешно превръща текста в реч. Според OpenAI, той е способен да генерира правдоподобен звук от текст и няколко секунди аудио.
Разработчиците също така са използвали и собствената система за разпознаване на реч с отворен код Whisper, за да конвертират речта в текст.
Как да качвате изображения в ChatGPT?
Можете да качите едно или повече изображения в ChatGPT. За да направи фокуса върху определена част от снимката, потребителят може да използва инструмента за рисуване направо в мобилното приложение.
За да изпратите изображение към чатбота, трябва да докоснете бутона „Фото“ и да направите снимката. Потребителите на iOS или Android трябва първо да докоснат бутона “Плюс“.
Разбирането на контекста на изображенията се осигурява от мултимодалните модели GPT-3.5 и GPT-4. Те прилагат уменията си за езиково разсъждение към широк набор от изображения, като снимки, скрийншоти и документи.
Сигурност на гласовите функции и разпознаването на изображения в ChatGPT
Разработчиците подчертават, че са обърнали много внимание на сигурността на функциите, така че да не могат да бъдат използвани от измамници. За да създаде гласов асистент, компанията е работила директно с различни актьори.
Специален екип е тествал модела за обработка на изображенията и за наличието на лъжовни и измислени генерирания, които са още известни в областта на изкуствения интелект като “халюцинации“ на ChatGPT. Проучването е позволило на разработчиците да се споразумеят за няколко ключови подробности за отговорна употреба.
OpenAI повтори ограниченията на модела и посъветва ChatGPT да не се използва във високорискови случаи, без подходящо валидиране.
Когато гласовите функции и качванията на изображенията идват в ChatGPT
OpenAI постепенно разширява възможностите за работа с изображения и глас. Според разработчиците актуализацията ще се появи до две седмици.
Функциите ще бъдат достъпни за абонатите на Plus и Enterprise.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!