Първи поглед отвътре в суперкомпютъра на Илън Мъск със 100 000 ИИ-ускорителя Nvidia H100

Най-четени

Емил Василев
Емил Василев
Емил Василев редовно превежда сложни научни теми на достъпен език — от въпроси като „Какво е имало преди Големия взрив?" до практическото приложение на биотехнологиите в лечението на болести. Тази комбинация от технологична и научна журналистика го прави един от най-разностранните автори в екипа на Kaldata.

Новият скъп проект на Илън Мъск – суперкомпютърът xAI Colossus за системи с изкуствен интелект отвори врати за първи път за обществеността. Журналисти от изданието ServeTheHome бяха допуснати да посетят съоръжението. Те разказаха подробно за клъстера, чието изграждане е отнело 122 дни и работи вече почти два месеца.

Сървърите са изградени на базата на платформата HGX H100 на Nvidia. Всеки от тях включва 8 ИИ-ускорителя Nvidia H100 и система за течно охлаждане Supermicro 4U all-in-one с възможност за гореща смяна на компонентите за всеки графичен процесор поотделно.

Сървърите са монтирани в стойки по 8, което води до 64 ИИ-ускорителя в една стойка. В долната част на всеки стелаж е разположен друг модул Supermicro 4U с резервирана помпена система и система за наблюдение на стелажа.

Стелажите са групирани в по 8 единици, което дава 512 графични процесора на масив. Всеки сървър има четири резервирани захранвания. В задната част на стелажите могат да се видят трифазни захранвания, Ethernet комутатор. Има и колектори с размерите на стелаж, които осигуряват течно охлаждане. Клъстерът Colossus съдържа повече от 1500 стелажи или около 200 масива. ИИ-ускорителите на тези масиви са инсталирани само за три седмици, заяви по-рано главният изпълнителен директор на Nvidia Дженсън Хуанг.

Поради високите изисквания за широчина на честотната лента на ИИ-суперклъстера, който непрекъснато работи по обучението на големи езикови модели (LLM), инженерите на xAI трябваше да положат усилия по отношение на мрежите.

Всяка графична карта е оборудвана със специален 400 GbE мрежов контролер с допълнителен 400-GbE мрежов адаптер за всеки сървър. Това означава, че всеки сървър Nvidia HGX H100 разполага с 3,6 Tbps Ethernet – да, целият клъстер работи с Ethernet, а не с InfiniBand или други екзотични интерфейси, стандартни за суперкомпютрите.

Суперкомпютърът за обучение на ИИ-модели, включително Grok 3 изисква не само графични процесори, но и памет и централни процесори, но xAI разкрива само частично информация за тях. На видеото, което е частично цензурирано се вижда, че за това са отговорни сървърите с x86 чипове в корпуси Supermicro – те също са с течно охлаждане и са проектирани да действат или като хранилище, или като централен процесор за работни натоварвания.

На обекта са инсталирани и батерии Tesla Megapack. Когато клъстерът работи, може да има внезапни колебания в потреблението на енергия, така че тези батерии с капацитет до 3,9 MWh всяка трябваше да бъдат инсталирани между електрическата мрежа и суперкомпютъра като енергиен буфер.

АбонаментВсичко важно от света на технологиите, директно в пощата ти.

С абонирането приемате нашите Условия и Политика за поверителност. Може да се отпишете с един клик по всяко време.


Коментирайте статията в нашите Форуми. За да научите първи най-важното, харесайте страницата ни във Facebook, и ни последвайте в Google Новини, TikTok, Telegram и Viber или изтеглете приложението на Kaldata.com за Android, iPhone, Huawei, Google Chrome, Microsoft Edge и Opera!

Нови ревюта

Подобни новини