8月6日,AMD扔了一颗"深水炸弹":正式宣布收购AI芯片初创公司Taalas。收购金额没公开,但这不重要。重要的是Taalas的技术路线,可能会彻底改写AI推理芯片的游戏规则。
为什么说这条路线是革命性的?因为Taalas干了一件几乎所有芯片公司都不敢干的事——把大模型直接刻进硅片里。
不做通用芯片,把模型"写死"在硬件上
现在主流的AI推理方案,不管是英伟达GPU还是AMD的Instinct加速器,走的都是通用计算路线。CPU/GPU跑模型,模型权重存在HBM(高带宽内存)里,每次推理都要从HBM读取。这条路线的问题是:HBM又贵又缺,而且内存带宽已经成了推理速度的瓶颈。
Taalas的思路完全不同。他们不做通用芯片,而是针对特定模型,把模型权重直接蚀刻进硅片,做成专用集成电路(ASIC)。权重不再需要从内存读取,推理数据流在硅片内部完成。测试数据相当炸裂:首款测试芯片HC1,台积电6纳米工艺,跑Llama 3.1 8B模型时,每秒能生成16,960个token。作为对比,英伟达GPU跑同样模型大约350 tokens/s——差了将近48倍。
而且这还只是第一代产品。Taalas计划今年夏天推出第二代HC2芯片,单芯片支持200亿参数。更关键的野心在于:通过流水线并行,50颗加速器就能撑起万亿参数级大模型。
AMD的全栈野心:GPU+ASIC混合打法
AMD买Taalas不是随便买个"小玩具"。AMD高管Vamsi Boppana的原话是,要把Taalas技术整合进AMD全栈AI平台,包括Helios机架方案、Instinct GPU、EPYC CPU和ROCm软件生态。
知情人士透露的玩法是这样的:计算密集型的提示词处理阶段,用Instinct GPU扛;token生成这类高并发的轻量推理任务,卸载到Taalas加速器。客户先在Instinct上跑通模型、验证效果,确认没问题了,再迁移到Taalas上跑大规模推理,形成一种"tick-tock"节奏。这种"胖+瘦"架构,比纯GPU方案省钱太多。
还有一个更隐秘的战略意图:绕开HBM。英伟达已经在考虑下调下一代Rubin Ultra GPU的HBM容量,因为供应链实在跟不上了。AMD通过Taalas的方案,完全不依赖HBM,在这一轮供应瓶颈里反而占了先手。
对AI行业意味着什么
推理成本一直是AI落地最大的拦路虎。大模型每回答你一句话,背后都在烧钱。GPU贵,HBM更贵,电费也不便宜。如果Taalas的方案能把推理效率提升一个数量级——哪怕只提升几倍——都足以让很多"因为太贵所以不做"的AI应用跑起来。
更长远来看,这代表了一种新思路:AI芯片不一定非要"通用"。当某个模型足够好、足够稳定、被足够多的人使用的时候,把它"固化"到芯片里,可能是最经济的选择。这条路一旦走通,未来可能会出现为GPT、Claude、千问等主流模型定制的"专属推理芯片"。到那时候,AI的成本结构就跟今天完全不一样了。
当然,风险也存在。模型迭代太快,今天刻进去的模型明天就可能过时。Taalas的方案也有对应的解法——第二代HC2预留了微调适配器空间,可以通过更新SRAM里的适配器来适配模型小版本升级。至于大版本换代,那确实需要新芯片。但因为制造成本比GPU低得多,这个代价是可接受的。
一句话总结:AMD这步棋,赌的是"推理为王"时代的到来。如果大模型真的从"训练军备竞赛"进入"推理大规模商用"阶段,那把模型刻进硅片,可能比造更强的GPU更有前途。
48倍的差距不是优化,是代差。如果Taalas真的能量产,英伟达在推理端的好日子可能就到头了。
把模型“刻进硅片”这个思路其实不新鲜,Google的TPU本质上也是这个逻辑。但Taalas的关键突破是绕开了HBM,这在当前供应链下太重要了。
我比较好奇的是:模型更新怎么办?GPT-5升GPT-6,你的芯片是不是就废了?文章里提到了微调适配器,但大版本换代呢?
AMD这几年的收购节奏明显在加速:Silo AI做软件、ZT Systems做服务器、Taalas做推理芯片。苏妈这是在下一盘很大的棋啊。
最关键的一句话:“推理成本是AI落地最大的拦路虎”。谁先把推理成本打下来,谁就是下一个十年的赢家。