8月25日,OpenAI做了一件事:把Realtime API从Beta状态正式移除了,同时发布了一个叫gpt-realtime的新模型。
听起来好像只是一次常规升级?其实不是。这次更新的核心信号就一句话:AI语音Agent,从"能跑Demo"正式进入"能上生产线"了。
以前Demo很酷,但没法商用
如果你关注AI语音有一段时间,你一定见过各种炫酷的Demo。AI打电话订餐、AI做客服、AI帮你预约牙医。效果很惊艳,但有一个致命问题:你很难把它接进真实的业务系统。
为什么?因为Demo环境和生产环境完全是两回事。Demo里你一对一对话,网络稳定,用户配合。生产环境呢?客服电话同时进来几百个,用户可能说着说着打断你,背景噪音、方言口音、信号不好,全是大坑。
以前做语音AI,通常要拼三四个模型:语音转文字(STT)、文字理解推理(LLM)、文字转语音(TTS),再加一个流程编排。每多一层就多一个出错的机会,延迟也一层一层叠加。用户等两秒没反应,就挂了。
gpt-realtime解决了什么
gpt-realtime是一个端到端的语音到语音模型。什么意思?就是不需要STT和TTS了,用户说话直接进去,AI理解后直接用语音回出来。一步到位,延迟大幅降低。
这次更新有几个关键能力:
第一,支持SIP电话接入。这意味着你可以直接把这个模型接进企业现有的电话系统,不用另外搭一套。对做客服的公司来说,集成成本直接砍掉一大块。
第二,支持远程MCP工具调用。AI在通话过程中可以实时查数据库、查订单、查日历,然后把结果告诉你。不是事后处理,是边聊边查。比如你打电话问航班状态,它能当场查、当场说,不用让你"稍等"。
第三,支持图片输入。这个比较有意思。你打客服电话的时候,可以拍张照片发过去,AI能看懂图片内容。比如你拍了个路由器的指示灯照片,AI能直接判断故障原因。视觉+语音的组合,比纯语音的天花板高太多了。
降价20%这个信号
同步还降价了。音频输入从每百万Token 40美元降到32美元,音频输出从80美元降到64美元。降幅20%。
看起来绝对值还是不便宜,但对比一年前语音AI的成本,这已经是从"奢侈品"降到了"耐用品"。关键不是看单价,而是看性价比:一个能直接接电话系统、能边说边查数据、能看图说话的AI语音Agent,一个月能帮你省掉多少人工客服成本?
对中小企业来说,这笔账已经开始能算过来了。
对Agent赛道意味着什么
我觉得gpt-realtime最大的意义不在于"语音AI更好了",而在于它把Agent的能力从文字世界延伸到了语音世界。
以前Agent主要活在Chat界面里。你得打字、它回字,交互效率有天花板。现在语音打通了,Agent的使用场景一下宽了很多。开车的时候、做饭的时候、走路的时候,你都没法打字,但你可以说话。语音是Agent走向"随时在线"的必经之路。
而且有个细节值得注意:gpt-realtime支持理解语气线索,比如笑声、犹豫、叹气。这意味着AI不只是听你"说了什么",还在感知你"怎么说的"。这个能力一旦成熟,语音AI的体验会从"能用"跃升到"舒服"。
竞争格局也在变
OpenAI这次更新之后,语音Agent赛道的竞争明显加速了。Anthropic的Claude Voice、Google的Gemini Live都在发力。三家的路线略有不同:OpenAI主打SIP电话和工具调用的生产集成能力,Google的优势在多模态和端侧部署,Anthropic则在对话自然度上做得更细。
对开发者来说,这是好事。竞争越激烈,价格越低,能力越强,选择越多。语音Agent的技术门槛在被快速拉平,接下来比的是谁的场景做得更深、谁的集成体验更好。
AI打电话这件事,终于从朋友圈的炫技视频,变成了可以上线的业务能力。这个转变,可能比我们想象的来得更快。

能听懂笑声和叹气这个细节好评。上次打客服电话,AI听不出来我已经在忍耐了,还在机械重复'请问您的问题是什么'…?
降20%听起来不多,但对比一年前的语音AI成本,这已经从天价变成了正常定价。明年估计还能再降一半
图片输入+语音的组合我比较看好。之前帮一个做家电维修的朋友想过这个场景:用户打电话说洗衣机不转了,AI客服让你拍张照片,看到故障灯代码后直接告诉你原因和解决方案。不用等师傅上门,5分钟搞定。这种场景以前做不到,现在技术链路终于通了。
以前AI打电话就是智障机器人,念完一级菜单念二级菜单。现在能边聊边查数据了,这进步不是一点半点
SIP电话接入这个功能才是真正的杀手锏。以前做AI客服最痛的就是集成,要对接各种电话系统、PBX、IVR,工程量巨大。现在直接支持SIP协议,企业现有电话系统几乎零改造就能接入。这比模型能力提升10%都有价值。