先说结论:一个叫Science Agent的AI,在NatureBench上拿了第一,超过了Claude Code、Codex、Gemini CLI这些通用编程Agent。
它干的活跟「AI写代码」完全是两码事。给它一个任务描述和一份数据,它能在4小时内自己设计模型、写代码、训练、调优,全程没人插手。不搞虚的,这东西是真跑通了。
这是谁做的
团队来自UCSD,带队的是电气与计算机工程系副教授谢澎涛。他们之前做的AIBuildAI,能自动构建AI模型,在OpenAI的MLE-bench上排过第一,也拿了约400万美元融资。这次的Science Agent,是在这个基础上往「AI for Science」再走了一步。
评测用的是NatureBench,90个任务全部来自Nature系列期刊的真实论文,覆盖生命科学、材料、能源、物理。规则也狠:Agent看不到原论文和方法,只拿任务描述、数据和评价目标,自己找解法,每个任务限时4小时。
成绩到底怎么样
结果有点超出预期。90个任务里,25.6%超过了论文报告的最佳方法,57.8%达到或超过论文里的最高水平。也就是说,一半以上的任务,它做到了跟人类顶尖研究持平甚至更好。
要知道,人类做个顶尖模型,通常要花几周甚至几个月,文献调研、方法设计、代码实现、实验验证、反复调优。它把这个周期压到了4小时。
它到底怎么「炼丹」的
拿一个具体任务说事。这个任务来自2025年Nature Computational Science上的一篇论文,做的是预测非编码变异对基因表达的调控效应。
给Agent的输入只有两部分:任务描述,和论文公开的训练数据。不告诉它用什么模型、什么算法。拿到任务后,它先设计几个候选模型,然后让Coding Agent写代码、debug,跑通之后开始训练、调参。第一版结果通常不是最优,它会根据结果重新改模型设计,再改代码、再训练、再验证,一直迭代到找到更好的方案。
最后它搞出来的模型,对远距离信息用位置、距离这些特征建模,对局部序列用深度学习建模,再把两部分整合起来。相比原论文人类的方法,性能提升了约14%。
这对「炼丹」意味着什么
最直接的一点:模型开发的重复劳动,正在被自动化,而且已经能超过人类最好水平。调参、改代码、跑实验、看结果再改,这套流程它干得比人快还比人稳。
但别急着焦虑。数据还是人准备的,问题还是人定义的。Science Agent目前自动化的,是「拿到任务和数据之后」这段最耗时的建模过程。真正决定方向的,还是人。
所以我的判断是:炼丹的门槛会继续降,但「定义好问题、准备对数据」这件事,会越来越值钱。不搞虚的,能跑的才是硬道理。

所以以后调参这种活真要被AI替代了?我们这些写prompt的瑟瑟发抖。
本质不是AI取代科学家,而是把「执行」自动化,把「定义问题」的价值放大。分工在变,不是取代。
数据看,57.8%任务达到或超过论文最高水平,这个数字已经很说明问题了。剩下的42%是天花板,也是机会。
AI自己做科研、超过人类最好水平,这个信号比很多大模型发布都值得关注。科研的范式真要变了。
我看重的是工程落地那部分——设计候选模型、debug、迭代,这套自动化流水线可以直接抄作业。