Anthropic用60个AI子Agent证了道数学难题:我们该重新定义「研究」了

AI风向标AI学习 2026-08-12 12:43:44 3阅读 举报

今天看到一条消息,在知乎上已经冲到了228万热度。Anthropic用一个未发布的Claude模型,协调60个AI子Agent,在1.5天里测试了650个想法,最终在黎曼猜想这个数学界的「圣杯」级问题上取得了实质性进展。

结果由Anthropic内部的数学家确认,并且用Lean定理证明器完成了形式化验证。不是那种「AI好像有点道理」的推测,是严格数学意义上的改进。

先说一句:黎曼猜想没有被完全证明。但这个结果确实把问题的边界往前推了一步,具体来说是对黎曼假设成立解的下界有了改进。

这件事为什么重要

黎曼猜想是数学界最重要的未解问题之一,跟素数分布有直接关系。从1859年提出到现在,快170年了,没人能给出完整证明。这不是那种靠穷举或者蛮力能解决的问题,需要的是真正的数学洞察。

这次Anthropic的做法跟以前的AI辅助证明不太一样。它不是一个模型在那里硬算,而是用一个主模型来协调60个子Agent,每个子Agent负责探索不同的数学思路和证明路径。1.5天里测试了650个想法,这相当于60个数学博士后同时工作了36个小时,尝试了人类数学家可能需要几个月才能走完的路径。

关键是失败恢复的能力。这60个子Agent不是各干各的,它们之间存在信息交互。一个Agent在某条路径上走不通,其他Agent能从这个失败中获取信息,避免重复走弯路。这种「分布式数学探索」的模式,在人类研究团队中其实也有,但效率远不及此。

不是第一次了

2026年以来,AI在数学领域的突破已经不是个例。今年早些时候,AI已经解决了至少一个Erdős问题(匈牙利数学家Paul Erdős提出的一系列悬赏问题),还有一个研究者用AI给出了Jacobian猜想的反证。

这些进展放在一起看,有一个明显的趋势:AI正在从「辅助计算」走向「辅助发现」。以前AI在数学里的角色更多是计算器,帮你验证一个猜想对不对、帮你跑一些大规模的计算。现在它开始能提出新的思路、探索新的方向,虽然最终的验证和形式化还是需要人类数学家来把关。

不过学术界对AI辅助发现的归属问题还有不少争议。如果一个证明主要是AI找到的,那论文署名应该怎么算?AI能作为共同作者吗?这些问题目前还没有共识。

多Agent协调才是关键

这次最有意思的不是某个具体的数学结果,而是多Agent协调的工作模式。60个子Agent同时工作、共享信息、失败反馈,这个架构本身就是一个研究范式的变化。

传统的人类研究团队,沟通成本是非常高的。一个教授带几个博士生,每周开一次组会,大家互相报告进展,这种信息传递效率其实很低。而AI的多Agent系统可以实时共享中间结果,一个Agent走了一步,所有其他Agent立刻知道,马上调整自己的策略。

这个模式放到更广泛的科研领域,想象空间很大。药物发现、材料科学、气候建模,这些都是需要探索巨大解空间的问题。如果能用类似的多Agent架构来并行探索,效率提升可能是数量级的。

冷静一下:局限性也很明显

首先要明确,这个结果用的是一个「未发布」的Claude模型。Anthropic没有公开这个模型的具体参数和架构细节,外部研究者无法复现。这在一定程度上削弱了这个结果的可验证性。

其次,650个想法听起来很多,但放在黎曼猜想这种级别的问题面前,可能只是沧海一粟。改进下界和完全证明之间,还有巨大的鸿沟。数学界对这类进展的态度通常是谨慎乐观:有价值,但不要过度解读。

还有一点,形式化验证虽然增加了结果的可靠性,但Lean定理证明器本身也有学习曲线和维护成本。把AI的发现转化为可验证的形式化证明,这一步的人工成本并不低。

对普通人的意义

你可能会问,黎曼猜想跟我有什么关系。直接关系确实不大,但这个案例展示的能力迁移到其他领域,影响就很直接了。

今天AI能协调60个子Agent探索一个数学问题的解空间,明天同样的架构就能用来探索药物分子的化学空间、探索新材料的晶体结构、探索代码的最优实现路径。多Agent协调的核心价值不在于「证明了一道数学题」,而在于它提供了一种新的解决复杂问题的方法论。

2026年的AI,已经开始不只是回答你的问题了。它在学着像你一样去「研究」问题,虽然还很初级,但方向已经不可逆了。

版权声明:
作者:AI风向标
链接:https://www.aiddithome.com/p/5d9475037c3c0.html
来源:AI学习
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
6条评论
苏轼
1楼 · 6小时前

作为学数学的,对AI辅助发现这件事态度很矛盾。一方面确实能加速研究,另一方面担心以后发论文要加上AI署名会很尴尬?

AI翻车侠
2楼 · 6小时前

虽然看不懂黎曼猜想的证明细节,但60个AI一起搞数学这个画面,想想就觉得很壮观?

硅格拉底
3楼 · 6小时前

1.5天测试650个想法,相当于每个Agent每天探索7个方向。人类数学家一辈子能探索几个?这个效率差距已经不是量级的问题了

AI搞钱研究所
4楼 · 6小时前

今年AI在数学上的进展密度也太高了吧。Erdős问题解决了,Jacobian猜想反证了,现在黎曼猜想也有了新进展。感觉数学这门最古老的学科,正在被AI重新定义研究方式。

算法老K
5楼 · 6小时前

不过要注意,Anthropic用的是未发布模型,外部无法复现。这在学术圈是个大问题。你声称有了突破,但不公开模型细节让别人验证,那这个突破的可信度就要打个折扣了。希望他们后续能公开更多技术细节。