Френският математик и програмист Фабрис Белард, основател на проектите QEMU, FFmpeg, BPG, QuickJS, TinyGL и TinyCC, публикува новия формат за кодиране на аудио TSAC. Както и свързаните с него инструменти за компресиране и декомпресиране на аудио файлове. Форматът е фокусиран върху предаването на данни с много нисък битрейт. Например 5,5 kb/s за моно и 7,5 kb/s за стерео, като същевременно поддържа приемливо качество на музиката и речта. Използването на TSAC дава възможност за опаковане на музикална композиция с продължителност 3,5 минути и честота на дискретизация 44,1 kHz (стерео) във файл с размер 192 KB. Неговото качество е почти неразличимо от оригинала за ухото на неизкушен лаик. Посочва се, че разработките на проекта се разпространяват под MIT лиценза. Но засега сорс кодът не се предлага за изтегляне.
TSAC се базира на аудио кодека Descript, който е разширен, за да поддържа стерео звук най-важното е, че се използва друг модел за машинно обучение, базиран на невронна мрежа с архитектура „трансформър“. Това е позволило да се увеличи степента на компресия, като се реконструират изгубените детайли, отчитайки модела на човешкото слухово възприятие. Целият модел заема около 200 MB в компресиран вид и е проектиран в детерминирано представяне, което гарантира един и същ резултат независимо от използвания CPU/GPU и броя на нишките, участващи в изчисленията.
Енкодерът може да работи, като използва само CPU за изчисленията (поддържат се AVX2 инструкции за ускоряване). Но за постигабнето на висока производителност се препоръчва използването на GPU. В сегашния си вид CUDA API може да се използва за ускоряване с помощта на графичните процесори на NVIDIA, базирани на микроархитектурите Ampere, ADA и Hopper. Това са RTX 3090, RTX 4090, RTX A6000, A100 и H100 с поне 4 GB видеопамет. FFmpeg се използва за конвертиране на аудио файловете преди кодирането.
Освен това можем да отбележим актуализацията на разработената от Bellar помощна програма ts_zip. Тя е предназначена за ефективно компресиране на текстовите данни с помощта на механизъм за прогнозиране на символите. Той се базира на система за машинно обучение и големия езиков модел RWKV 169M v4. При компресиране на архив на Wikipedia тази наистина полезна програма успя да компресира данните 7,3 пъти, а при компресиране на кода на Linux kernel 1.2 – цели 7,8 пъти. За сравнение, нивата на компресия при използване на помощната програма xz бяха съответно 4,7 и 5,5 пъти. Цената на високата ефективност на компресиране е ниската скорост на компресията и високите изисквания към ресурсите (минимум 4 GB RAM). При система с графичен процесор RTX 4090 ефективността на компресиране е приблизително 1 MB/s.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!