9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra。发布会后,总裁格雷格·布罗克曼说了一句很少见的话:我个人认为,我们可能已经到达AGI了。
他没有用官方口径,用的是第一人称,还特意加了"可能"。但这句话的分量,比任何官方公告都重。
它到底强在哪
先看一个让人不太敢信的数字:在公认最难的ARC-AGI-3测试上,Astra拿了98.6%。上一代旗舰GPT-5.6 Sol只有7.8%,Anthropic的Claude Opus 5是30%。
这不是从80分到90分的进步,是量级上的跨越。其他关键基准也很能打:顶级数学研究FrontierMath Tier 4拿到97.6%,研究生级问答GPQA Diamond 96%,真实软件工程DeepSWE 74.1%。
但Astra真正让人意外的,是它开始替你干活了。
会操控电脑的AI
过去AI操作电脑,走的是调API的路子,软件厂商先写好接口,AI再通过接口操作。这就意味着每一款软件都得专门适配AI。
Astra换了条路:它像人一样,直接看屏幕上的像素,然后移动鼠标、敲键盘。OpenAI给它的口号很直白,你在电脑上能做的任何事,Astra都能替你做。
演示里,它在KiCad里完成了一块PCB的布局走线,用时2分54秒;在Blender里搭了一栋房子,再导进虚幻引擎生成可漫游场景;甚至对着一句话,完成了eBay商品上架的整个流程。
这意味着,那些不会为AI写API的软件,企业内部用了十年的老系统、专业设计软件,它都能用了。像一个新入职的员工,不懂代码,但看得懂界面。
AGI了吗?先别急着下结论
Astra强,但不是全面碾压。在"人类最后的考试"HLE上,它拿了57.2%,两天前Anthropic发布的Claude Fable 5.1是65%。创意写作、综合知识这些维度,它也没拉开差距。
还有个细节要留意:ARC-AGI-3那个98.6%,依赖OpenAI的"有状态测试框架",允许模型多轮尝试积累上下文。在普通API调用下,分数会明显缩水。横向比较时,这个前提不能忽略。
成本也摆在那。Astra的API定价是上一代的2.5倍,输入每百万token 10美元。训练用了得州Stargate数据中心超过10万张GPU。
真正该关注的变化
比起"AGI来了"这个判断本身,我更在意另一个信号:大模型的竞争,正在从"谁回答得更聪明",转向"谁能把事情做完"。
这一周内,Anthropic发了Claude Fable 5.1,谷歌发了Gemini 3.8 Flash,Meta发了Muse Spark 1.3。大家不约而同,把力气都花在了编码、Agent和复杂任务执行上。
AI从聊天窗口走进软件界面,这件事的影响,可能比任何一个基准测试的分数都大。因为会聊天的AI是玩具,会干活的AI才是工具。
硅基世界,万物皆码。当代码开始替人跑腿,我们确实该认真想一想,接下来会发生什么。
总裁说「我个人认为」,这大概是AI圈最贵的「个人观点」了?
能替你干活,和该不该替你干活,是两回事。AGI的真正考验不在能力,在边界,它替你做决定的那一刻,谁负责?
98.6%这个数字我第一眼以为是假的。不过看到「有状态测试框架」这个前提,冷静了不少。评测分数要打折看,但「看屏幕直接操作软件」这条路,方向是对的。
操控电脑这招才是真降维打击。API那套每款软件都要适配,永远追不上。看像素加移动鼠标,等于把十年前所有遗留系统全盘接手了。
ARC-AGI-3从7.8%到98.6%,这个跳变太大,反而让我警惕。有状态多轮测试和真实场景差距不小,等第三方在无状态条件下复测完再下结论。