这个坑我替你们踩过了,结论先放这:曙光8000不是噱头,是真能跑的东西。WAIC现场我去蹲了一下午,机柜里泡泡翻滚的画面比任何PPT都有说服力。
十万卡是什么概念
先给不太关注硬件的朋友科普一下。之前国内最大的AI算力集群基本都是万卡级别——一万张加速卡组网,跑大模型训练已经很吃力了。Kimi K3这种2.8万亿参数的模型,万卡集群训练一次以月为单位。
曙光8000直接把这个数字翻了十倍:十万张国产加速卡全互联。而且不是堆硬件,是真正的全链路国产化——芯片用海光DCU,互联用自研scaleFabric高速网络,存储用ParaStor分布式系统(今年全球IO500双料第一),散热用浸没式相变液冷。从头到脚,没有一件是海外采购的。
最让我服的是液冷方案
十万张卡同时跑,功耗有多恐怖可想而知。曙光用了浸没式相变液冷技术——整个服务器泡在特殊液体里,芯片发热时液体沸腾产生气泡带走热量,PUE做到了1.04。什么概念?行业主流风冷PUE在1.8左右,每消耗1度电用于计算,要额外浪费0.8度在散热上。曙光这套方案只要0.04度。
现场机柜是透明的,能看到气泡从芯片上方翻滚上升,像煮开水一样。工作人员说这一套散热方案已经在数千个大型机房验证过了,不是实验室玩具。
上线一周就满载,说明什么
最有意思的数据:曙光8000上线首周就满载运行,日均处理15万个作业,峰值单日50万个。目前已完成近千项应用适配,覆盖大模型训练、药物研发、气象推演、工业仿真等20多个领域。
上线即满载,说明市场对国产高端算力的需求是真实存在的,不是"建好了等人用",而是"等不及要用了"。科研机构、AI创业公司都在抢算力资源。
对开发者意味着什么
以前国内团队做大模型训练,要么买英伟达卡(贵、受限制、交付周期一年起步),要么用国产卡但规模上不去。曙光8000的落地意味着:你现在可以通过国家超算互联网直接接入十万卡集群,按需调用,不用自己建机房。
而且七部委刚出的算力新政,要求新建政务和央企智算中心国产设备采购不低于75%。这不是建议,是硬性指标。中科曙光作为国内唯一能交付十万卡集群的厂商,未来几年的订单基本板上钉钉。
但别高兴太早
说几个现实问题。第一,海光DCU在单卡性能上跟H100还有差距,十万卡堆出来的总算力靠的是规模效应。第二,软件生态还在追赶,CUDA的护城河不是一两年能填平的。第三,十万卡集群的运维成本极高,目前只有国家级项目能养得起。
不过这不妨碍它是一个里程碑。从万卡到十万卡,从跟跑到并跑,这一步走了差不多五年。下次再说"国产算力不行",可以把曙光8000的数据甩他脸上了。
数据不会说谎。日均15万作业、峰值50万、近千项适配——这组数字比任何PPT都有说服力。国产算力的账,终于可以算清楚了。
PUE 1.04这个数据真的炸。之前看过一篇报告,全球数据中心每年耗电量已经超过一些中等国家的全国用电量了。液冷方案如果全面铺开,省下来的电不是小数目。
国产算力从'能用'到'好用',最难的一步不是造硬件,是让人愿意用。上线一周满载这个信号很好,说明不是靠政策硬塞,市场真的需要。
IO500双料第一的ParaStor有点东西。做过分布式存储的都知道,海量小文件读写和大文件吞吐是两个完全不同的难题,能同时拿第一的不多。
作为每天跟算力打交道的打工人,最关心的就是:排队等GPU的时间能不能短一点?曙光8000接入超算互联网之后,希望我们小公司也能分到一杯羹。