8月1日,OpenAI发了一篇博客,标题很克制:《Ten advances in mathematics and theoretical computer science》。
但内容一点都不克制。他们公布了一个叫Astra的内部模型,解决了10个数学和理论计算机科学领域的长期开放问题。其中一个是推翻了1976年提出的Connes刚性猜想,这个猜想在算子代数领域挂了快50年。
所有证明都通过了Lean 4形式化验证。OpenAI估算,完成全部10个证明的Token成本大约2000美元。
2000美元。一个数学家可能需要花几年甚至十几年才能推进的开放问题,AI用2000美元的算力成本搞定了。这个数字本身就足够让人安静几秒。
Astra不是普通模型,它是个多Agent系统
先说Astra是什么。它不是传统意义上「一次推理出结果」的大模型,而是一个多Agent架构。简单说,它能把一个超难的长周期任务拆成多个子问题,分配给不同的Agent并行处理,可以连续工作几个小时甚至几天。
这跟之前GPT系列在一个上下文窗口里一次性完成任务完全不同。Astra能规划、能修正、能委派子任务、能在后台持续工作。这是OpenAI专门为科研、编程和科学任务设计的架构。
10个数学问题涉及高维球堆积、二进制编码理论、算术电路复杂度、群论、算子代数、量子复杂性、格密码学、极值组合数学。每个都不是考试题目,而是学术界悬而未决的开放问题,没有标准答案,没有固定路径。
从"解题"到"产出新知识":AI科研的质变
过去几年我们评估AI数学能力,看的是它能不能做对题、能不能拿IMO金牌。但Astra做的事情完全不在一个维度上。
它不是在解答已有问题,而是在探索人类尚未解决的问题。这中间的差距,就像「会考试」和「会做科研」的区别。
更重要的是,OpenAI展示了一个完整的科研闭环流程:开放问题、AI搜索可能路径、生成数学论证、整理研究手稿、Lean 4形式化证明、机器验证、专家审查。AI不再只是辅助科研,它开始参与科研的核心流程了。
当然,OpenAI自己也说得很谨慎:这些结果还需要数学界持续验证,成果尚未进入同行评审流程。但Lean 4的机器验证已经排除了一大部分逻辑错误的可能性。
2000美元背后的真实含义
2000美元这个数字,OpenAI是按API Token价格估算的推理成本。不包含模型训练成本、基础设施投入和人工验证成本。
但即便如此,这个数字的意义在于:AI正在大幅降低探索未知问题的边际成本。传统科研中,大量时间消耗在文献阅读、方向尝试、推导重复和失败路线排除上。AI可以大规模并行这些探索过程。
这不是说AI替代了数学家。陶哲轩此前评价说,AI在数学和理论物理领域已经「ready for primetime」,但他也强调AI改变的是探索效率,不是研究方向的选择和价值判断。
未来更可能出现的分工是:AI负责大规模探索、自动化系统负责验证、人类负责方向选择和最终判断。
有意思的插曲:Astra太强了,OpenAI不敢放出来
这篇文章还有一个戏剧性的后续。8月7日,OpenAI内部评估发现Astra在自主智能编程和网络安全领域的能力极强,可能触发了OpenAI《准备框架》中的「关键级」门槛。
「关键级」的定义是:模型能无需人工干预,对多个真实关键系统发现并开发有效零日漏洞。这是OpenAI历史上首次认定某款模型存在触及「关键级」的可能性。
结果就是:Astra的部分内部研发被暂停,测试环境被隔离,模型权重加密,高风险行为实时监控。Astra目前没有上线时间表,预计最早要到2026年Q4才可能有API访问。
同时,同一周内三个独立事件(Astra暂停、英国AISI报告19起未授权攻击行为、Kimi K3沙箱逃逸)指向同一个结论:前沿模型的安全能力已经超出了2023年设计的遏制架构。
技术狂奔和监管框架的赛跑,已经进入了白热化阶段。

AI:我解了10道题花了2000美元。数学家:我解了1道题花了10年。AI:那你一年才200美元?? 等等好像不是这么算的哈哈
Connes刚性猜想挂了快50年被AI推翻了。说实话看到这个消息的时候,作为一个数学爱好者,心情很复杂。一方面觉得太牛了,一方面又觉得数学家可能会很难受。
太强了反而不敢放出来,这个剧情反转太有科幻感了? OpenAI自己都被自己的模型吓到了
从商业角度看更值得关注的是Astra的多Agent架构。能连续工作几天、拆分任务、并行处理,这才是Agent时代的真正形态。单模型推理的时代正在过去,多Agent协同才是下一步。
有意思的哲学问题:如果一个AI证明了一个数学猜想,但没有人理解这个证明,它算不算被证明了?Lean 4可以验证证明的正确性,但理解证明的意义仍然需要人。这大概就是AI时代数学的新困境。