NVIDIA FlashAttention-4: Революция, която удвоява скоростта на ИИ

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

Технологичният гигант NVIDIA обяви официалното пускане на FlashAttention-4 – четвъртото поколение на един от най-критичните алгоритми за оптимизация в съвременното дълбоко обучение. Новата версия обещава фундаментална промяна в начина, по който се обучават големите езикови модели (LLM), като удвоява производителността в сравнение със своя предшественик. Този пробив е насочен директно към решаване на най-сериозното предизвикателство в архитектурата на ИИ: „тесните места“ при трансфера на данни между паметта и изчислителните ядра на графичните процесори.

Разработката, ръководена от Трей Дао и екипа му, се фокусира върху оптимизирането на механизма Attention (внимание), който е гръбнакът на Transformer архитектурите. Чрез интелигентно управление на нивата на кеш паметта и минимизиране на излишните операции по четене и запис, FlashAttention-4 позволява на системите да обработват огромни масиви от информация с безпрецедентна скорост.

Преодоляване на хардуерните ограничения

NVIDIA FlashAttention-4: Революция, която удвоява скоростта на ИИ

Основният акцент във FlashAttention-4 е пълната синергия с най-новите архитектури на NVIDIA Hopper и Blackwell. Докато предишните версии на алгоритъма се фокусираха върху общото ускорение на изчисленията, четвъртата итерация е прецизно калибрирана за новите тензорни ядра и формати за данни като FP8. Според първичните тестове, интеграцията на FlashAttention-4 позволява:

  • Двойно увеличение на скоростта при обучение на моделите от клас GPT-4 и Llama-3.
  • Значително намаляване на консумацията на енергия на ниво изчислителен клъстер.
  • Възможност за работа с експоненциално по-дълги контекстни прозорци, което е критично за анализа на цели библиотеки от документи или сложен програмен код.

Това подобрение е от жизненоважно значение за компаниите, които се стремят да намалят разходите за облачни изчисления. По-бързото обучение означава по-кратко време за заетост на скъпоструващите графични ускорители H100 и B200, което директно оптимизира капиталовите разходи на ИИ лабораториите.

Стратегическо предимство за Blackwell архитектурата

Пускането на FlashAttention-4 съвпада с масовото навлизане на новата архитектура Blackwell на пазара. NVIDIA стратегически позиционира софтуерната си оптимизация като ключов фактор, който прави нейния хардуер незаменим. Чрез използването на специфични инструкции за паралелизация и подобрено планиране на нишките (thread scheduling), алгоритъмът извлича максимума от пропускателната способност на HBM3e паметта.

Експертите от индустрията отбелязват, че докато конкуренти като AMD и специализираните ИИ чипове на Google (TPU) се опитват да догонят суровата мощ на NVIDIA, именно софтуерният стек на компанията от Санта Клара остава нейната най-силна „крепост“. FlashAttention-4 е поредното доказателство, че иновациите в алгоритмите са толкова важни, колкото и броят на транзисторите в самия чип. Този софтуерен скок на практика удължава жизнения цикъл на текущия хардуер, предоставяйки на разработчиците инструменти за създаване на следващото поколение „супермодели“ без необходимост от физическо разширяване на дейта центровете.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини