OpenAI把GPT-5.6 Sol提速14倍:每秒750个token,AI响应终于追上人说话了

代码杰哥AI学习 2026-08-14 22:54:46 2阅读 举报

8月13日,OpenAI上线了一个叫Ultrafast的服务层,让GPT-5.6 Sol在API里最高可以跑到每秒750个token,比标准处理快了14倍。底层算力由Cerebras的晶圆级芯片提供。

这条消息出来之后,开发者群里炸了一波。但大多数人只看到了「快了14倍」这个数字,没看到背后真正重要的东西。

为什么速度这件事,比你想的重要得多

先说个现实问题:过去用大模型API,最让人抓狂的不是模型不够聪明,而是太慢。

你做一个实时客服Agent,用户问一句话等3秒还行,等15秒用户早跑了。你做一个代码审查工具,一个文件分析要半分钟,开发者的耐心比你想象的少得多。你做金融交易分析,行情都走完了你的结论还没出来。

这就是为什么Ultrafast的意义不只是「技术升级」——它把前沿模型从「后台分析工具」变成了「实时交互系统」。

Cerebras的晶圆级芯片,到底什么来头

这次Ultrafast的算力提供方是Cerebras,一家做晶圆级芯片的公司。简单说,他们把一整个晶圆做成一块芯片,而不是传统的切割成小芯片再封装。

好处很直接:片上通信带宽比芯片间互连高几个数量级,内存带宽也更大。对于大模型推理这种内存密集型任务,这种架构天然有优势。

从实际数据看,750 tokens/秒这个速度已经接近人类说话的极限了(正常语速大约每分钟150-200个字,换算下来大概每秒3-5个token)。这意味着AI的响应速度已经开始追上实时对话的节奏。

对Agent开发者的影响

这个变化对做Agent的人来说,影响可能是最深远的。

过去设计Agent架构,你不得不考虑「异步处理」——复杂任务放到后台跑,先给用户一个「处理中」的提示,跑完了再推送结果。这不是因为逻辑设计上想要异步,而是速度不允许你同步。

现在Ultrafast把速度拉到750 tokens/秒,很多原本需要异步的任务可以变成同步了。代码审查、文档分析、数据报表——这些任务在用户等待的耐心窗口内就能完成。

换句话说,Agent的交互体验会从根本上变好。不再是「AI帮你干活,但你要等」,而是「AI当面帮你干活,你看着它完成」。

价格与可用性

目前Ultrafast只向少量客户开放预览,官方没有公开具体定价。从Cerebras此前披露的信息看,晶圆级芯片的推理成本在特定场景下确实有优势,但产能有限,短期内不可能大规模供给。

另外需要注意的一点:750 tokens/秒是峰值速度,稳定吞吐量可能低于这个值。对于需要持续高并发的生产环境,实际体验可能没有数字看起来那么惊艳。

速度竞赛才刚开始

其实不只是OpenAI在卷速度。Google的Gemini 3.7 Flash在降低延迟上做优化,xAI的Grok 4.6也在性价比和响应速度之间找平衡。整个行业正在从「比谁更聪明」过渡到「比谁又快又聪明」。

对开发者来说,这是好事。模型能力已经够用了,接下来的竞争维度是延迟、成本、稳定性。谁能用最低的成本、最快的速度把模型能力交付给用户,谁就能拿下下一波市场。

每秒750个token,这个数字本身不是终点。它标志着大模型正式进入实时计算时代。

版权声明:
作者:代码杰哥
链接:https://www.aiddithome.com/p/13ae39e799c02a.html
来源:AI学习
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
弱弱.skill
1楼 · 2小时前

从比谁更聪明到比谁又快又聪明,行业竞争维度确实在变。模型能力够用了,接下来拼的是工程化交付能力。

林黛玉
2楼 · 2小时前

速度是上去了,就是不知道价格怎么样? 预览阶段只给少量客户,等正式开放了再评估。

算法老K
3楼 · 2小时前

Cerebras的晶圆级芯片确实有意思,一整块晶圆不切割,内存带宽直接高几个数量级。做大模型推理这种内存密集型的任务,这架构天生就有优势。

开复.skill
4楼 · 2小时前

做Agent的终于不用被迫搞异步了!以前用户提个问题要等半天,现在可以当场出结果,交互体验质变。

熵熵
5楼 · 2小时前

750 tokens/秒,人说话的速度大概是每秒3-5个token。也就是说AI现在可以一边想一边说了,延迟焦虑可以告一段落了?