• 我的订阅
  • 科技

全球最大AI超算内部首次曝光!马斯克19天神速组装10万块H100,未来规模还将扩大一倍

类别:科技 发布时间:2024-11-01 09:29:00 来源:新智元

全球最大AI超算内部首次曝光!马斯克19天神速组装10万块H100,未来规模还将扩大一倍

【新智元导读】一文揭秘全球最大AI超算,解析液冷机架和网络系统的创新设计。这台全球最大AI超算Colossus由xAI和英伟达联手建造,耗资数十亿,10万块H100仅半个多月搭建完成,未来规模还将扩大一倍!

两个月前,马斯克才刚刚自曝了xAI的Colossus超算,称其是世界上最强大的AI训练系统。

最近,马斯克又宣布了一条振奋人心的消息——集群即将扩展到20万张H100/H200显卡!

全球最大AI超算内部首次曝光!马斯克19天神速组装10万块H100,未来规模还将扩大一倍

同时,ServeTheHome也发布了一条15分钟的视频,公布了这台超算的详情!

来自ServeTheHome的Patrick Kennedy带着摄影机探访了这台超级计算机

这台全球最大的AI超级计算机Colossus位于美国田纳西州孟菲斯,配备了10万个英伟达Hopper GPU,并由英伟达Spectrum-X以太网提供网络传输支持。

目前,Colossus的第一阶段建设已完成,集群全面上线,但这并不是终点。它将很快迎来升级,GPU容量将翻倍,新增5万块H100 GPU和5万块下一代H200 GPU。

Colossus正在用于训练xAI的Grok,并为X Premium订阅用户提供聊天机器人功能。

在训练超大规模的Grok时,Colossus展现了前所未有的网络性能。在网络结构的所有层级中,系统在流量冲突的情况下没有经历任何应用延迟降级或数据包丢失。

通过Spectrum-X拥塞控制,它保持了95%的数据吞吐量。这种性能水平无法通过标准以太网实现,标准以太网在传输中会产生数千次流量冲突,数据吞吐量仅能达到60%。

由于保密协议的限制,这台超级计算机的一些细节并没有透露。不过,像Supermicro GPU服务器等关键部件的介绍在视频中都有所涉及。

液冷机架

Colossus集群的基本构建单元是Supermicro液冷机架。

每个机架包含八台4U服务器,每台服务器配备八个英伟达H100,共计64个GPU。

八台此类GPU服务器再加上一个Supermicro冷却分配单元(CDU)及相关硬件,构成了一个GPU计算机架。

这些机架以八台为一组排列,共512个GPU,并通过网络连接,形成更大系统中的小型集群。

全球最大AI超算内部首次曝光!马斯克19天神速组装10万块H100,未来规模还将扩大一倍

xAI使用的是Supermicro 4U通用GPU系统。

这是目前市面上最先进的AI服务器,有2个原因:其一是它的液冷程度;其二是设备的可维护性。

该系统被放置在托盘上,无需将系统从机架中移出即可维护。1U机架分流器可为每个系统引入冷却液并排出温热液体。快速断开装置让液冷系统可以迅速移除,甚至可以人工单手拆装;移除后,托盘即可拉出以便维护。

下图是一张该服务器原型的照片,展示了这些系统的内部构造。

全球最大AI超算内部首次曝光!马斯克19天神速组装10万块H100,未来规模还将扩大一倍

SC23展示的Supermicro 4U通用GPU系统:支持液冷英伟达HGX H100和HGX 200

上图SC23原型中的两个x86 CPU液冷模块相对常见。

特别之处在于右侧:Supermicro的主板集成了几乎所有HGX AI服务器中使用的四个Broadcom PCIe交换机,而非将其单独安装在另一块板上。Supermicro为这四个PCIe交换机设计了定制液冷模块。

其他AI服务器通常是在风冷设计的基础上加装液冷,而Supermicro的设计则完全从零开始,为液冷而打造,且所有组件均来自同一供应商。

打个通俗的比方,这类似于汽车——有些车型先设计为燃油车,之后再安装电动动力系统,而有些车型从一开始就是为电动车设计的。这款Supermicro系统就属于后者,而其他HGX H100系统则属于前者。

Patrick怒赞道:测评了各种各样的液冷系统设计,这款Supermicro系统遥遥领先于其他系统!

网络系统

这里的每条光纤连接速率为400GbE,是常见1GbE网络速率的400倍。此外,每个系统拥有9条这样的连接,意味着每台GPU计算服务器的带宽达到约3.6Tbps。

打个比方,如果1GbE的普通家庭网络好比是一条单车道公路,那这个400GbE就像是一条拥有400车道的高速公路。而每个系统有9条这样的「高速公路」,相当于每台GPU计算服务器拥有9条这样的超宽带公路,总带宽达到3.6Tbps。

这个带宽甚至超过了2021年初顶级Intel Xeon服务器处理器在所有PCIe通道上所能处理的连接总量。

GPU的RDMA网络构成了该带宽的大部分。每个GPU都有自己的NIC。

全球最大AI超算内部首次曝光!马斯克19天神速组装10万块H100,未来规模还将扩大一倍

在这里,xAI使用英伟达BlueField-3 SuperNIC和Spectrum-X网络。英伟达的网络堆栈中加入了一些独特技术,可以帮助数据绕过集群中的瓶颈,确保数据准确地传输到指定位置。

这是一个重大突破!许多超级计算机网络使用的是InfiniBand或其他技术,而这里采用的是以太网。

以太网是互联网的骨干,因此它具有极强的扩展性。这些庞大的AI集群已扩展到一些更小众技术未能触及的规模。对于xAI团队而言,这确实是一个大胆的举措。

全球最大AI超算内部首次曝光!马斯克19天神速组装10万块H100,未来规模还将扩大一倍

除了GPU的RDMA网络外,CPU也配备了400GbE连接,但使用完全不同的交换结构。xAI为其GPU和集群的其余部分分别配置了独立的网络,这在高性能计算集群中是非常常见的设计。

除了高速集群网络外,还有低速网络用于管理接口和环境设备,这些都是此类集群的重要组成部分。

参考资料:

https://www.servethehome.com/inside-100000-nvidia-gpu-xai-colossus-cluster-supermicro-helped-build-for-elon-musk/3/

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-11-01 12:45:01

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

马斯克宣布训练“世界上最强大的人工智能” !万卡集群背后的算力竞赛迅猛升级
当地时间7月22日,马斯克在社交平台X上发文宣布,XAI团队、X团队、英伟达及支持公司于当地时间凌晨4时20分开始在孟菲斯超级集群上进行训练
2024-07-24 14:02:00
AI春晚:黄仁勋称需要更强大的GPU,马斯克吹捧英伟达最适合AI
...段时间的研发,机器人的“ChatGPT时刻”或许近在咫尺。 马斯克吹捧:英伟达最适合AI这场座无虚席的演讲让黄仁勋被网友笑称为“AI界的泰勒·斯威夫特”,也再次打响英伟达作
2024-03-19 21:04:00
美国芯片巨头市值一夜暴涨1.34万亿!一颗芯片炒到近30万元 马斯克此前狂买1万个
...模型,将需要更强大的芯片。 03.AI落地离不开算力支撑马斯克:获得GPU比获得毒品还难据澎湃新闻此前援引Business Insider4月11日报道
2023-05-25 17:13:00
十万块英伟达H100打造,马斯克宣布“全球最大 AI 训练集群”投用
IT之家 7 月 23 日消息,马斯克现宣布,孟菲斯超级计算机集群(Memphis Supercluster)于当地时间凌晨 4:20 开始进行训练
2024-07-23 13:51:00
马斯克梦想AI超算霸权,旗下公司却\
3月22日消息,尽管埃隆·马斯克(Elon Musk)致力于打造能与英伟达抗衡的超级计算机,但他旗下公司与英伟达的关系却日益紧密
2024-03-22 16:44:00
马斯克:只要满足电力需求,比人类更聪明的AGI将在两年内实现
特斯拉CEO埃隆·马斯克。视觉中国 资料图马斯克预测,只要电力和硬件供应能够满足日益上涨的需求,人工智能(AI)可能会在两年内超越人类智能。当地时间4月8日,特斯拉CEO埃隆·马
2024-04-09 15:34:00
「谍战」开启!基建狂魔马斯克122天交付10万卡超算,对手大恐慌派间谍飞机侦查
【新智元导读】卷到没边了,122天交付10卡超算,马斯克造Colossus的神奇速度,直接把对手们干懵逼了!OpenAI和微软甚至因此谈崩了。现在,超算大战干脆升级为谍战模式,对
2024-11-19 14:01:00
马斯克xAI超算将扩张十倍!100万个GPU值得英伟达开个分公司
马斯克的人工智能初创公司xAI正在以惊人的速度发展,其承诺将其在孟菲斯建设的超级计算机Colossus扩大十倍,以容纳超过100万个GPU。大孟菲斯商会周三发表声明称,xAI的扩
2024-12-05 17:39:00
买不到GPU,马斯克自曝AI巨兽Dojo!自研超算挑战英伟达,约等于8千块H100
【新智元导读】多年来,马斯克一直在公开谈论Dojo——这台超算将成为特斯拉人工智能雄心的基石。他最近表示,随着特斯拉准备在10月推出Robotaxi
2024-08-05 09:33:00
更多关于科技的资讯:
浪潮智慧文旅“智享商旅 聚力同行”2025浪潮商旅服务日成功举办
鲁网12月30日讯12月25日,由山东浪潮智慧文旅产业发展有限公司主办、山东浪潮智慧空间技术服务有限公司承办的“智享商旅·聚力同行——2025浪潮商旅服务日”在浪潮科技园圆满落幕
2025-12-30 17:23:00
潮新闻讯 浙商,是商业期刊的常客。2025年,他们的名字却接连登上《细胞》(Cell)《自然》(Nature)《科学》(Science)等学术期刊的作者栏
2025-12-30 17:52:00
扎根毕节十年,年产能超7500万只,出口覆盖欧非亚——贵州贵航新能源科技有限公司,已成为推动区域新能源产业链发展的“关键一环”
2025-12-30 18:35:00
肯悦咖啡苹果冰雕点亮冰城 代言人白敬亭助阵亮灯迎新春
2025年12月29日,肯悦咖啡在哈尔滨中央大街举办了一场别开生面的“红苹果心愿季”冰雕点灯仪式。肯悦咖啡的巨型红色咖啡杯造型冰雕搭配“水晶”苹果
2025-12-30 18:50:00
博士创新站典型案例|保定市鑫诺电科软件开发有限公司博士创新站:校企协同创新赋民生
当前供水行业智能化转型加速推进,保定市鑫诺电科软件开发有限公司作为本地企业,在技术层面面临自主开发的智能客服系统缺乏适配技术
2025-12-30 19:36:00
京东京喜自营2025年成交额增长10倍 5大产业带订单量破亿
2025年即将结束,回看这一年,外贸逆袭、市场反内卷、AI全面爆发,用户消费需求回归理性,带动品质消费。今日,京东旗下特价购物品牌京喜自营披露了这一年的成绩单——2025年实现成交额10倍增长
2025-12-30 19:48:00
事关以旧换新!河南公开征集
大河网讯 为深入推进2026年消费品以旧换新政策实施,河南省商务厅日前正式发布《河南省2026年消费品以旧换新家电及数码智能产品参与品牌厂家征集公告》
2025-12-30 19:55:00
博士创新站典型案例|英利能源发展有限公司博士创新站:携手高校突破技术瓶颈
在全球“双碳”目标推动下,光伏产业成为新能源领域核心赛道。晶体硅太阳电池占据光伏市场主要份额,但高效光伏电池需切割分片制成组件
2025-12-30 18:04:00
博士创新站典型案例|石家庄数英仪器有限公司博士创新站:攻克高次谐波源国产化难题
随着新能源发电并网比例不断提高,光伏逆变引入的谐波频率日益升高,对电网谐波测量提出了新的技术要求。当前,国内市场主流谐波标准源的谐波次数普遍低于100次
2025-12-30 18:16:00
还在用App来回倒腾文件?鸿蒙6一碰即传,感受分享的魔法
傻瓜相机的发明,将人们从复杂的调焦、测光操作中解放出来,把摄影门槛拉低到有手就行。而在这个随身电子设备越来越多的时代,人们需要在跨设备文件
2025-12-30 13:04:00
把数字安全感还给用户:HarmonyOS 6的三道主动防御防线
在万物互联的数字时代,个人隐私的边界正变得日益模糊。我们或许都曾经历过这样的时刻:经常接到诈骗骚扰电话,或是家人手机里充斥着乱七八糟
2025-12-30 13:05:00
中国消费者报杭州讯(记者施本允)近日,浙江省台州市消费者权益保护委员会发布2025年电动自行车安全头盔比较试验报告。在随机购买的25款样品中
2025-12-30 14:20:00
高途高中朱汉祺获评“2025·教育匠心人物” 双博士背景赋能英语教育创新
2025年度央广网教育盛典近日落下帷幕,大会以“智启未来 育梦致远”为核心议题,对教育领域深耕教研、推动行业发展的标杆人物进行表彰
2025-12-30 14:21:00
聚焦深度运营,感恩会员同行:太原吾悦广场会员盛典暨跨年狂欢季璀璨启幕
岁末流光,新年序启。新城控股集团太原吾悦广场隆重推出“吾悦会员盛典”,诚挚回馈每一位会员的相伴。作为城市潮流社交与家庭欢聚的核心地标
2025-12-30 14:52:00
“坐地日行八万里,巡天遥看一千河。”2025年10月19日,甘肃酒泉,中科宇航力箭一号遥八运载火箭以“一箭三星”的方式
2025-12-30 14:53:00