昨天看到一条消息,愣了一下。英伟达,那个靠GPU打遍天下无敌手的公司,居然自己造CPU了,而且已经交付给了OpenAI、Anthropic和SpaceX。不是PPT,是量产。
这颗CPU叫Vera,88个Olympus核心,176线程,单核性能是传统x86的1.8倍,AI智能体任务综合性能提升约50%。内存带宽更夸张,1.2TB/s,传统DDR5服务器的两倍,功耗却不到一半。
说白了,英伟达不想只卖GPU了。它要做CPU+GPU+网络的全栈方案,直接卖"AI整机"。
为什么突然造CPU
这件事背后的逻辑其实不复杂。过去两年AI训练靠GPU堆算力,大家买H100、B200就像不要钱一样。但从2025年下半年开始,AI的重心从训练转向推理。训练是一次性的,推理是持续的,而且规模会越来越大。
推理场景对CPU的要求跟训练完全不同。几千个AI智能体同时运行,每个都在独立调用工具、执行任务,CPU如果跟不上,GPU再强也白搭。传统x86 CPU在单线程满载时性能拉胯,根本扛不住这种Agentic AI的工作负载。
这就是Vera的机会。它从设计之初就是为AI智能体优化的,满载下单核性能碾压x86,内存带宽翻倍。Wolfe Research预测,Vera芯片平均售价约5000美元,今年出货量130万颗。
不止英伟达,AI公司都在造芯
更有意思的是,不只是英伟达在动。DeepSeek刚被曝开启新一轮融资,投前估值710亿美元,涨了37%。但这笔钱不是拿来训练新模型的,而是建数据中心、造自己的ASIC推理芯片。
智谱也在做类似的事。OpenAI搞了Jalapeño芯片,Anthropic在评估自研方案,Meta推了Iris芯片。全球头部AI公司不约而同走向造芯。
原因很直接:当AI从训练驱动变成推理驱动后,每生成一个Token的成本,成了决定生死的关键。用别人的GPU太贵了,不如自己造。
对普通人意味着什么
可能你会觉得这些离自己太远。但其实影响已经开始传导了。推理成本的下降,直接意味着AI工具的定价会更便宜。去年用一次AI Agent可能要几块钱,今年可能只要几毛钱。
而且当推理不再是瓶颈,AI智能体的运行速度和稳定性会大幅提升。Cursor测试的Agent Swarm架构已经在4小时内通过80%的SQL测试套件,峰值提交速度每秒1000次。这种效率,一年前想都不敢想。
另外一个信号是,三星上个月成立了直属CEO的机器人事业部RX。英伟达从卖芯片到卖整机,三星从做手机到做人形机器人。2026年的AI竞争,已经不是比谁的模型参数大了,而是比谁的基础设施更完整。
小结
英伟达Vera的交付,不只是一颗新CPU上市的事。它标志着AI行业正式进入"全栈战争"时代。模型参数只是入场券,从芯片到推理到应用的完整链路,才是真正的护城河。
对开发者来说,好消息是成本在降、速度在升。对行业来说,洗牌才刚刚开始。谁能用最低的成本跑出最多的Token,谁就能活到下一轮。

智谱也在造推理ASIC,这个消息之前没怎么报道。看来头部AI公司都看明白了:靠买GPU不是长久之计。
说句实话,普通开发者最关心的是推理价格什么时候降。模型再强,调一次API花一块钱,大部分人还是用不起。好消息是这些芯片量产后,成本确实会往下走。
DeepSeek 710亿估值不拿来训模型而是造芯,说明开源大模型的商业逻辑变了。光靠模型不够,得控制推理成本才能活下去。三星也成立机器人事业部了,2026年全栈战争没跑了 ?
5000美元一颗CPU,一年出130万颗,光这一块就是65亿美元的生意。黄仁勋的棋盘越下越大了。
推理成本下降才是真正改变游戏规则的事。训练模型贵,但推理是每天都在烧的钱。英伟达从卖GPU到卖整机,本质上是在帮客户降低推理的总拥有成本。Vera这颗CPU定位很准,Agentic AI场景确实需要更强的单核性能和内存带宽。