Новият 4-битов метод за обучение на LLM е толкова добър, колкото и 8-битовият метод

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Нов подход за обучение на големите езикови модели (LLM), разработен от изследователи от Nvidia, може да обучава модели, които не само превъзхождат водещите 4-битови формати по отношение на стабилността и точността, но и достигат нивото на производителност на 8-битовия формат FP8. В същото време технологията NVFP4 използва два пъти по-малко памет и само част от изчислителните ресурси.

Квантуването на моделите е техника, която се използва за намаляване на изчислителните разходи и потреблението на памет при изпълнение и обучение на AI моделите. Тя работи чрез конвертиране параметрите на модела, или теглата, от формати с висока точност, като 16- и 32-битови числа с плаваща запетая (BF16 и FP32), във формати с по-ниска точност. Основната цел на квантуването е да се намали размерът на модела, като същевременно се запазят възможно най-много от неговите характеристики.

През последните години 8-битовите числа с плаваща запетая (FP8) се превърнаха в популярен индустриален стандарт, постигайки добър баланс между производителност и ефективност. Те значително намаляват изчислителните разходи и изискванията за памет за обучение на LLM, без да намаляват съществено точността.

Следващата логична стъпка е преминаването към 4-битови числа с плаваща запетая (FP4), което обещава да намали още повече – наполовина консумацията на памет и да подобри още повече производителността на съвременния хардуер.

Новият 4-битов метод за обучение на LLM е толкова добър, колкото и 8-битовият метод

Този преход обаче не е лесен. Съществуващите 4-битови формати, като MXFP4, често не могат да предложат същото ниво на точност като 8-битовите си аналози. Трябва да се направи компромис между цена и производителност.

NVFP4 преодолява проблемите, свързани със стабилността и точността, присъщи на другите методи FP4, чрез по-сложна архитектура и целенасочена методология на обучение. Основният проблем с 4-битовата точност е изключително ограниченият обхват: тя може да представя само 16 различни стойности. При конвертиране от формат с висока точност данните могат да се изкривят, което намалява точността на модела. NVFP4 прилага по-усъвършенстван подход към многостепенното мащабиране, осигурявайки „по-точно и надеждно представяне на тензорните стойности по време на обучението“, твърдят от Nvidia.

За да тества метода, екипът е обучил хибридния модел Mamba-Transformer с 12 милиарда параметъра върху масив от 10 трилиона токена. След това те са сравнили производителността му с базовия модел, обучен във формат FP8. Резултатите показват, че по време на целия процес загубите от обучението и точността на модела NVFP4 са почти идентични с модела FP8 при последващи задачи.

Представянето се е запазило в широк спектър от области, включително логически, математически и здравни задачи, с лек спад в представянето в тестовете за програмиране в по-късните етапи на обучението. Според разработчиците това е първата успешна демонстрация на обучение на езикови модели с милиарди параметри и 4-битова точност.

Успехът на NVFP4 показва, че е възможно да се намалят разходите за логическа изходна мощност чрез използване на по-малки модели, без да се жертва производителността. А също така, че в бъдеще разходите за обучение на LLM могат да спаднат толкова много, че организациите да могат да обучават свои собствени модели от нулата, а не само да подобряват съществуващите, пише Venture Beat.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини