Новият скъп проект на Илън Мъск – суперкомпютърът xAI Colossus за системи с изкуствен интелект отвори врати за първи път за обществеността. Журналисти от изданието ServeTheHome бяха допуснати да посетят съоръжението. Те разказаха подробно за клъстера, чието изграждане е отнело 122 дни и работи вече почти два месеца.
Сървърите са изградени на базата на платформата HGX H100 на Nvidia. Всеки от тях включва 8 ИИ-ускорителя Nvidia H100 и система за течно охлаждане Supermicro 4U all-in-one с възможност за гореща смяна на компонентите за всеки графичен процесор поотделно.
Сървърите са монтирани в стойки по 8, което води до 64 ИИ-ускорителя в една стойка. В долната част на всеки стелаж е разположен друг модул Supermicro 4U с резервирана помпена система и система за наблюдение на стелажа.
Стелажите са групирани в по 8 единици, което дава 512 графични процесора на масив. Всеки сървър има четири резервирани захранвания. В задната част на стелажите могат да се видят трифазни захранвания, Ethernet комутатор. Има и колектори с размерите на стелаж, които осигуряват течно охлаждане. Клъстерът Colossus съдържа повече от 1500 стелажи или около 200 масива. ИИ-ускорителите на тези масиви са инсталирани само за три седмици, заяви по-рано главният изпълнителен директор на Nvidia Дженсън Хуанг.
Поради високите изисквания за широчина на честотната лента на ИИ-суперклъстера, който непрекъснато работи по обучението на големи езикови модели (LLM), инженерите на xAI трябваше да положат усилия по отношение на мрежите.
Всяка графична карта е оборудвана със специален 400 GbE мрежов контролер с допълнителен 400-GbE мрежов адаптер за всеки сървър. Това означава, че всеки сървър Nvidia HGX H100 разполага с 3,6 Tbps Ethernet – да, целият клъстер работи с Ethernet, а не с InfiniBand или други екзотични интерфейси, стандартни за суперкомпютрите.
Суперкомпютърът за обучение на ИИ-модели, включително Grok 3 изисква не само графични процесори, но и памет и централни процесори, но xAI разкрива само частично информация за тях. На видеото, което е частично цензурирано се вижда, че за това са отговорни сървърите с x86 чипове в корпуси Supermicro – те също са с течно охлаждане и са проектирани да действат или като хранилище, или като централен процесор за работни натоварвания.
На обекта са инсталирани и батерии Tesla Megapack. Когато клъстерът работи, може да има внезапни колебания в потреблението на енергия, така че тези батерии с капацитет до 3,9 MWh всяка трябваше да бъдат инсталирани между електрическата мрежа и суперкомпютъра като енергиен буфер.
Всичко важно от света на технологиите, директно в пощата ти.
С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.
Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!