WAIC 2026上,华为干了一件让国产AI圈振奋的事——昇腾950超节点真机首次公开亮相。一个机柜整合1024张AI芯片,这不是简单堆料,而是把上千颗芯片"像一张大芯片一样协同工作"。
说实话,国产算力这几年没少被卡脖子。但这次昇腾950的表现,让我觉得那个"单芯片性能PK"的阶段可能要翻篇了。
1024张卡怎么"合"成一张大芯片
关键在于华为的灵衢互联协议。这不是普通的卡间互联,而是能把1024张AI芯片的数据传输时延压缩到3微秒。什么概念?人眨眼一次大概是30万微秒。也就是说,在这套系统里,芯片之间的"对话"速度比人眨眼还快10万倍。
这种超低时延意味着什么?意味着当你训练一个大模型时,1024张卡可以像一张超级大卡一样协同工作,不会因为卡间通信拖后腿。传统的做法是每张卡算自己的,然后定期同步,结果就是大部分时间在等。
从"单挑"到"团战"的转变
这次WAIC上,不只是华为。沐曦的曦景S600主打"零线缆",昆仑芯展出256卡超节点,中兴也有OEX超节点。整个国产算力阵营都在往"超节点"这个方向走。
这个转变很重要。之前大家都在比单芯片性能,谁的算力强、谁的功耗低。但当单芯片性能逼近物理极限后,胜负手就变成了"把多少颗芯片组网成一台低时延大机器"。
工信部的数据说,今年中国人形机器人整机产量有望突破10万台。这么多机器人需要大模型训练和推理,底座就是超节点集群。算力基础设施跟不上,机器人就"长不大"。
和国际玩家比,差距在哪
客观说,华为昇腾950的定位和英伟达的GB200 NVL72类似,都是通过高速互联实现多卡协同。但差距还是在的——软件生态。
英伟达的CUDA生态已经深耕十几年,全球几百万开发者在用。华为的CANN生态在追赶,但应用丰富度还有差距。这不是技术问题,是时间和生态积累的问题。
不过好消息是,国产大模型厂商都在积极适配昇腾。Kimi、Qwen、DeepSeek都在做昇腾优化,至少在国内这张牌能打。国际市场上,可能还需要更多时间。
超节点会成为2026年下半年主战场
行业有个判断:超节点会成为2026年下半年国产算力的主战场。单芯片性能已经逼近天花板,接下来比的是系统级集群能力。
对创业者来说,这意味着什么?意味着未来训练大模型,可能不再需要买英伟达的卡。国产算力虽然生态还不完善,但够用、便宜、供应链稳定。对于那些"不需要世界最强,但需要足够强+足够便宜"的场景,昇腾950们是不错的选择。
国产算力的故事,才刚刚开始。

1024张卡像一张大芯片,这个比喻很准确。但我更关心的是:这套东西贵不贵?中小企业用得起吗?
从技术路线看,华为走的是系统协同而非单卡极限的路子。这个方向是对的,单卡性能总有天花板,但系统协同没有。
搞过分布式训练的都知道,最难的不是算力,是通信。3微秒时延如果是真的,那昇腾950的训练效率会很可观。
一个问题:昇腾950超节点,用的是谁的代工?7nm还是5nm?如果被卡在制造端,产能跟得上吗?
3微秒时延这个数字很关键。之前很多国产集群号称千卡,但卡间通信拖后腿,实际效率很低。3微秒意味着是真协同,不是假协同。