8月24日,Hot Chips 2026大会现场,黄仁勋拿出了一组让全场倒吸凉气的数据。
首测数据:比GB300快30倍
英伟达首次公布了下一代旗舰级机柜Vera Rubin NVL72的片上实测数据。不是PPT,不是预估,是跑着DeepSeek-V4-Pro的真实Agent编码任务测出来的。
结果是这样的:对比当前主力机皇GB300 NVL72,Vera Rubin的每兆瓦吞吐量最高提升了30倍,Token成本最高降低了35倍。注意,是比已经很强的GB300再提升30倍,不是跟两年前的H200比。
有网友说了句大实话:"以前嫌H200三万美元一张贵,现在回头一看,H200连丐版都算不上了。"
为什么是30倍?不是靠单颗芯片
很多人第一反应是芯片制程又突破了。其实不是。Vera Rubin的飞跃来自"极限协同设计"——六颗核心芯片同时重新设计。
Rubin GPU负责大规模上下文处理,Groq 3 LPX负责极速Token生成,Vera CPU专门调度Agent的工具调用和子任务分发。再加上第六代NVLink的72 GPU互联,比以太网快10倍、延迟低3倍。NVFP4量化把模型权重压到4位精度,内存占用大幅缩减。
简单说,老黄不卖显卡了,他卖的是一整座"AI发电厂"。
老基准作废了,Agent时代需要新尺子
这次发布有个有意思的信号:英伟达官方宣布传统AI跑分基准全部作废。
过去的基准测试测的是固定长度的问答,比如8K或1K序列。但Agent的工作模式完全不同。OpenRouter的数据表明,一个Agent任务消耗的Token是普通聊天的15倍,Agent会不断推理、调用工具、协调子Agent、累积上下文。用旧的尺子量新的活儿,量不出来。
英伟达这次用了SemiAnalysis的AgentX基准,回放真实的代码编写会话,包含上下文增长、工具调用和子Agent生成。这才是Agent时代的真实工作负载。
Groq 3 LPX量产:每秒3400个Token
同一天,英伟达宣布Groq 3 LPX全面量产。这是去年花200亿美元收购Groq后推出的首款产品。
实测数据:运行Gemma 4 31B模型,10万Token超长上下文,输出速度3400 Token/秒,比竞品快4倍。编码任务中最大输出速度达到6981 Token/秒。生成5000个Token的时间从50秒降到1.5秒。
这套架构把上下文处理和Token生成分离开来——Rubin GPU管"读",Groq LPX管"写",各干最擅长的事。
马斯克连夜装机,还要送上太空
最具野心的棋是Vera CPU。这是英伟达专门为Agent造的CPU,88个自研Olympus核心,LPDDR5X内存带宽1.2TB/s。英伟达的逻辑是:Agent背后要跑上百步操作,工具调用、代码执行、上下文翻阅、数据处理,这些全压CPU身上,必须给它专门造一颗。
马斯克的SpaceXAI当天就宣布规模化部署Vera CPU,正在建设吉瓦级算力工厂驱动Grok。更疯狂的是,第一代"Starmind"AI卫星计划采用Vera Rubin NVL72系统,2028年大规模部署。算力直接打上太空。
对Agent行业意味着什么
算一笔账就明白了。当Token成本下降35倍,意味着24小时无休的数字员工在经济上变得可行。过去跑一个复杂Agent任务要几十美元的API费用,现在可能只要一两美元。
这会直接催生ToC端超级应用的大爆发。当调用成本低到可以忽略,产品设计的逻辑就变了——不再是"这个功能太贵不敢做",而是"还有什么场景没覆盖到"。
从一块GPU到整座Agent工厂,英伟达这次重新铺了整个Agent时代的地基。地基铺好了,上面的楼能盖多高,就看各路玩家的本事了。

虽然看不太懂技术细节,但'从一块GPU到一整座AI发电厂'这个说法我记住了。感觉英伟达的野心已经不是一家芯片公司了。
每次老黄发新品,我手里的显卡就贬值一次。这次直接变成了古董 ?
Token成本降35倍,打工人用AI摸鱼的成本也降了35倍?那我是不是可以更放心地摸鱼了 ?
有意思的是马斯克当天就宣布部署Vera CPU。这个人嗅觉一向灵敏,他知道算力就是AI时代的石油。SpaceXAI要上太空这步棋,本质上是在抢占近地轨道的算力资源,未来太空AI不再是科幻。
从数据看,Groq 3 LPX的3400 Token/秒输出速度才是真正改变游戏规则的数字。过去Agent交互最大的瓶颈就是响应延迟,用户等一个回复可能要几秒甚至十几秒。现在降到毫秒级,Agent的用户体验会质变。