买吗的超好奇户会节点0万一台,用
但麻烦也来了:GPU一旦跨服务器互联,好奇会买超节点确实好,节点对大模型训练来说,用户
而1T,好奇会买阿里云晒出了答案:灵骏真武 M890 单实例就能运行 Qwen3.8-Max、节点超节点似乎就只能成为土豪的用户玩具了。堆再多八卡机也干不好。好奇会买整个项目照样快不起来,节点向广域超节点演进。用户组成一个整体。好奇会买阿里巴巴集团 CEO 吴泳铭透露,节点可以有很高的用户技术门槛,
因为现在模型太大,千问计划训练 5—10T 参数规模的新模型。卡间互联带宽最高可达1200GB/s,
这样的超级巨无霸,
有了这样的云算力保底,从内存语义变成了网络(RDMA)语义。
甚至一台8卡GPU服务器,通信效率就会明显下降。买一台“计算机”。单卡早就装不下。就需要约 1TB 显存。低时延,运维,具体效果怎么样呢?
在本届云栖大会上,这些工作量,
搬完一次砖,
是不是有些夸张?但放在AI超节点的世界里,
可是,菊厂的上一代 384 卡超节点(CM384)据称价格超 6000万人民币。
这个实例把超节点的高性能和云服务的弹性、
对大多数企业来说,可以像云主机一样按需订阅,即便有了预算,让所有的GPU都能像机内互联一样,所有GPU走的是专用高速互联,这当然能解决显存容量问题。光装下 1T 参数的权重,
规模越大,性能更强,企业不必再为基础设施操心,通信语义也因为跨网络传输,单集群最高可扩展至50万卡,从而获得更高的训练和推理效率呢?
终极解法还真就是超节点。
N 记的上一代 72卡超节点(NVL72)价格约300万美元,就像几十位工程师共同完成一个项目,机房建设、每个人都很能干。运维操心,
大家一起协同工作,新一代的真武V900算力飙升三倍。GPU虽然连在了一起,跨机通信代价越明显,市场上对超节点的热情,这个数字只能算刚刚起步。
卡间通信不给力,
这还只是真武M890,
搭载真武V900的“新”灵骏超节点明年上半年就能上线,
如此一算,需要另外算账。还得空等数据同步,
而对于大模型推理来说,带宽打了折,搁谁都得掂量掂量。但也确实贵。1024张真武V900可以抱团变成一张超大GPU来扛活。推出了灵骏真武M890超节点实例。是Scale-out,无论大模型训练还是推理,
花两三千万,
如何才能让更多的GPU在一个计算域、更顺地跑起来。不需要为部署、
即便如此(成本高,支持最多1024张卡组成单一计算域。组成 GPU 集群,有些AI大模型需求,
有没有什么方案能让大家多快好省地用上超节点呢?
阿里云早就给出了解法↓
把超节点的硬实力和第一大云的云实力完美结合,不仅时延、还支持统一寻址。终于具象化了。
也就是说,好比抱团成为一张大GPU。这样的投入很难轻松拍板,阿里发布了搭载平头哥最新训推一体芯片真武V900的新一代超节点。多台八卡机堆成集群后,
大几千万的价格再加上机房基础设施、从采购到能用上,一旦跨了服务器,
同时,会被分摊给不同服务器上的不同GPU。AMD 的 72 卡超节点(Helios)价格超 500 万美元,
比如,配备9216GB显存,
这个过程,
模型越来越大,让超节点算力普惠更难
回到我们一开始的问题,
超节点究竟有啥魔力?天价了大家还拼命砸钱买最核心的一个原因,也可能是半年以后了。
云上超节点价值,
在今年的云栖大会上,那就多堆几台,Kimi K3 是 2.8T。就是如今模型尺寸越来越大了,
大家是一个计算域,
此时,
其中采用的Scaleup互联技术就是自研的ICN Switch,显存也不够用了。Kimi K3 这样的级别的模型。周期长),
而超节点采用的专用的Scale-up互联技术,需要GPU扛的,还要扛起多专家并行任务。动辄万亿级。就会造成GPU工作不饱满。
但大家没有坐在一个屋子,更多团队跨过这道门槛,还要扛KVCache。轻松拿捏万亿级参数大模型的训练和推理。
造出超节点很难,
这还只是设备价格,
这是因为,
刚刚结束的云栖大会上,让更多创新想法更快、智算普惠的意义,不只是模型权重,
这种云实例跟物理超节点相比,在单台八卡服务器中,
让顶尖算力不再局限于少数人的机房,GPU之间需要做频繁数据搬运和同步,就需要经过二道贩子:GPU↔网卡↔交换机↔网卡↔GPU。只是起步,
性能规格上单实例采用64卡互联架构,不只是高带宽、整体效率都会受影响。卡间互联带宽为800GB/s。跨机互联依靠RoCE或者IB网络。
几千万一套的超节点,最终影响整个集群的训练效率。
只因,
八卡服务器不够,MoE还会产生大量的All-to-All通信。制冷和后续运维,
因此,千问 3.8 是 2.4T,
万亿参数是什么概念?按 FP8 精度计算,来完成推理任务。把更多投入用于模型和应用。GPU之间的通信,却不该成为创新的门槛。就是让更多企业、易用融为一体。
这里面最大的区别在于,也不必斥巨资买个“祖宗”回家。却很难像机内八卡那样高效协同。干起活来总要隔空喊话,还是一浪高过一浪。
如果是MoE模型,




