Stability AI – компанията която разработи технологията с изкуствен интелект Stable Diffusion за преобразуване на текст в изображения обяви публичното представяне на Stable Audio – инструмент за генериране на кратки аудиозаписи въз основа на текстови описания. Stable Audio се основава на същите основни техники на генеративен ИИ, използвани в Stable Diffusion за генерирането на изображения.
„Stability AI е най-известна с работата си с изображения, но сега пускаме първия си продукт за създаване на музика, наречен Stable Audio. Идеята е много проста: описвате музиката, която искате да чуете и нашата система я генерира за вас.“
каза Ед Нютън-Рекс, вицепрезидент по аудио в Stability AI
Ед не е нов в света на компютърната музика: през 2011 година той основава стартъпа Jukedeck, който през 2019 година е закупен от TikTok. Технологията, която стои зад Stable Audio обаче се корени не в Jukedeck, а във вътрешното изследователско студио за създаване на музика на Stability AI, наречено Harmonai, създадено от Зак Евънс. Евънс обясни, че текстовият модел използва техника, известна като аудиоконтрастно предварително обучение на езика (CLAP). Моделът на Stable Audio има около 1,2 милиарда параметъра, което е приблизително същото като оригиналната версия на Stable Diffusion за генериране на изображения.
Stable Audio работи директно с необработени аудио образци, за да осигури по-високо качество на изхода. Моделът е обучен върху над 800 000 лицензирани музикални произведения от аудиобиблиотеката AudioSparks.
„Една от най-трудните задачи при създаването на текстово базирани модели е получаването на аудио данни, които са не само висококачествени, но и имат подходящи метаданни.“
обясни Еванс
Една от често срещаните задачи, които потребителите поставят пред моделите за генериране на изображения е да ги стилизират така, че да приличат на определен изпълнител. В случая на Stable Audio обаче потребителите няма да могат да поискат от изкуствения интелект да направи това – според създателите на Stable Audio повечето музиканти по-скоро искат да бъдат по-креативни.
Stable Audio ще бъде на разположение безплатно или в план Pro за 12 долара на месец. Безплатната версия ще ви позволява да създавате до 20 аудиозаписа на месец с продължителност до 20 секунди, докато Pro версията увеличава броя на записите до 500, а времето им за възпроизвеждане – до 90 секунди. Платената версия позволява и комерсиално използване на произведенията. Като част от пускането на пазара на Stable Audio Stability AI ще пусне и ръководство за текстови реплики.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!
