Стотици хиляди GPU в една мрежа. Microsoft стартира Fairwater, „суперфабрика за обучение на AI“ в планетарен мащаб

Най-четени

Даниел Десподов
Даниел Десподов
Новинар. Увличам се от съвременни технологии, информационна безопасност, спорт, наука и изкуствен интелект.

140 kW на стелаж, 800 Gbps между графичните процесори и 120 000 мили оптика. Там, където конвенционалните центрове за данни се предават, този едва започва.

Индустрията на изкуствения интелект изисква все повече изчислителни ресурси, а големите модели вече не се побират в обичайните облачни платформи. Ето защо Microsoft разработва инфраструктурата Fairwater – нов тип център за данни, предназначен за обучение на невронни мрежи в мащаби, които досега бяха недостъпни за комерсиалните системи. Компанията пусна поредния възел на този комплекс в Атланта, свързвайки го с първото съоръжение Fairwater в Уисконсин, ранните суперкомпютри за изкуствен интелект и глобалната мрежа Azure. Заедно тези елементи образуват разпределена инфраструктура, която компанията описва като суперфабрика за изкуствен интелект на планетарно ниво.

Идеята на Fairwater се основава на максималното увеличаване плътността на хардуера, участващ в обучението на моделите. Конвенционалните облачни структури са изградени около множество отделни клъстери с различни функции, които са свързани със сложна многослойна мрежа. Fairwater прилага различен подход. Тук стотици хиляди ускорители на NVIDIA са свързани в една плоска архитектура, за да образуват един общ изчислителен цикъл. Този дизайн стана възможен благодарение на опита, натрупан при изграждането на предишните поколения инфраструктури за изкуствен интелект и поддържането на широкомащабни задачи за обучение, които постоянно бяха възпрепятствани от мрежовите и хардуерните ограничения.

Съвременните модели вече не се обучават в рамките на един монолитен процес. Работата е разделена на етапи: предварително обучение, предварително обучение по конкретна задача, методи за обучение с подсилване и генериране на изкуствени данни. За гъвкаво разпределение на тези работни натоварвания Microsoft създаде AI WAN backbone – специална оптична мрежа, която свързва обектите на Fairwater и дава възможност на различните компоненти за обучение да бъдат премествани там, където работят по-ефективно. Това увеличава използваемостта на оборудването и ускорява изпълнението на задачите.

Стотици хиляди GPU в една мрежа. Microsoft стартира Fairwater, „суперфабрика за обучение на AI“ в планетарен мащаб

Едно от основните ограничения на клъстерите за изкуствен интелект са физическите разстояния. Колкото по-далеч са разположени ускорителите, толкова по-висока е латентността. При мащаби, измервани в трилиони параметри, дори минималните стойности стават значителни. Ето защо всичко, което прави Fairwater, е да намали разстоянията между елементите. Първо трябва да се започне с охлаждането: плътното разполагане е невъзможно без стабилно разсейване на топлината.

За тази цел се използва течна система, в която охлаждащата течност циркулира в затворен контур. Зареждането се извършва еднократно, след което съставът се подновява само при промяна на химичните параметри. Експлоатационният живот на течността е предвиден за повече от шест години. Обемът на първоначалното пълнене е сравним с годишните разходи на около двадесет къщи, но практически няма по-нататъшни загуби, тъй като не се използва изпарение. Това решение прави инфраструктурата значително по-екологична от конвенционалните водни системи.

Високата ефективност на разсейване на топлината позволява да се увеличи плътността на стелажите. Във Fairwater един стелаж е проектиран за приблизително 140 kW, а един ред стелажи – за 1360 kW. Нагретият флуид, преминал през студените плочи на ускорителите, се насочва към голям охладителен комплекс, който поддържа стабилна работа дори при непрекъснато AI натоварване.

Стотици хиляди GPU в една мрежа. Microsoft стартира Fairwater, „суперфабрика за обучение на AI“ в планетарен мащаб

Не по-малко важна особеност е двуетажната конструкция на сградата. Повечето AI задачи са чувствителни към дължината на кабелите, а тук всеки ускорител е свързан с всеки друг ускорител. Поставянето на стелажите в триизмерен обем значително намалява общата дължина на линиите, което намалява латентността, подобрява стабилността на мрежата и намалява разходите за поддръжка на комуникациите.

Захранването е отделно инженерно предизвикателство. Мястото в Атланта е избрано с оглед стабилността на местната електропреносна мрежа: тя може да осигури около 99,99% наличност при разходи, характерни за нива от около 99,9%. Този баланс дава възможност да се премахнат някои от традиционните средства за резервиране, като например местни генератори, големи UPS и двойно входно захранване. Това ускорява въвеждането в експлоатация и намалява разходите за инфраструктура, без да се прави компромис с надеждността.

Натоварванията, генерирани от невронните мрежи, обаче носят нови предизвикателства: внезапните промени в потреблението могат да предизвикат колебания в енергийната мрежа на даден регион. За да компенсира подобни ефекти, Microsoft използва няколко механизма. На софтуерно ниво през периодите на намалена активност се задействат спомагателни процеси, които изглаждат профила на потреблението. От хардуерна гледна точка ускорителите могат самостоятелно да ограничават собствения си енергиен профил. Тази схема се допълва от локални хранилища, които изравняват пиковете без използването на външни източници.

Стотици хиляди GPU в една мрежа. Microsoft стартира Fairwater, „суперфабрика за обучение на AI“ в планетарен мащаб

Изчислителната част на Fairwater се основава на ускорители NVIDIA Blackwell и специализирани сървъри. Един комплекс интегрира тези графични процесори в клъстер, който се мащабира отвъд стандартните мрежови архитектури чрез нетривиални подходи към пропускателната способност и взаимосвързаността. В рамките на един шкаф до 72 ускорителя са свързани чрез NVLink за минимална латентност и висок обмен на данни. Такъв шкаф поддържа до 1,8 TB/s трафик между графичните процесори и дава на всеки ускорител достъп до повече от 14 TB споделена памет.

След това стелажите се комбинират в по-големи модули – капсули – и след това в единна схема на ниво суперкомпютър. В нея се използва двустепенна опорна мрежа на базата на Ethernet, която осигурява до 800 Gbps между ускорителите. Използването на отворена екосистема за Ethernet и операционната система SONiC позволява използването на масово произвеждан хардуер, без да се обвързва със специализирани решения.

За да се справи с претоварванията, Microsoft е оптимизирала механизмите за обработка на пакетите, добавила е маршрутизация с разделяне на трафика и е въвела високочестотна телеметрия. Тези инструменти предотвратяват претоварването, ускоряват откриването на загубите и повторното предаване и осигуряват гъвкаво балансиране на натоварването. Всичко това поддържа ниска латентност и стабилна производителност при интензивни задачи с изкуствен интелект.

Стотици хиляди GPU в една мрежа. Microsoft стартира Fairwater, „суперфабрика за обучение на AI“ в планетарен мащаб

Дори и с тези нововъведения един сайт не е в състояние да обслужва модели с трилиони параметри, затова е изградена оптичната опорна мрежа AI WAN, която свързва сайтовете в обща система. За една година Microsoft е положила повече от 120 000 мили оптични линии на територията на САЩ. Тези линии свързват няколко поколения суперкомпютри и позволяват на разпределената мрежа да работи като единна логическа машина.

Основната разлика на новия подход е, че трафикът вече не трябва да следва един и същ маршрут, независимо от естеството на задачата. Вече е възможно да се избират различни режими на обмен: локален в рамките на един сайт, разширен между сайтовете или смесен. Това прави инфраструктурата по-гъвкава и подобрява използването на ресурсите.

Новият възел Fairwater в Атланта показва как Microsoft преустройва инфраструктурата, за да отговори на изискванията на съвременните модели. Той съчетава изчисления с висока плътност, енергийно ефективна технология, интелигентно охлаждане и мащабируеми мрежови вериги, предназначени за екстремни натоварвания. Всичко това създава основа за обучение на големи невронни мрежи, които доскоро бяха достъпни само за изследователските центрове.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини