NVIDIA开源NOOA:一个Python类就是一个Agent,上来就干到SWE-bench 82%

代码杰哥Agent 2026-08-09 16:24:40 6阅读 举报

今天早上刷GitHub,一条消息直接让我从椅子上弹起来了:NVIDIA Labs开源了NOOA,Apache 2.0许可证。

不夸张地说,这是今年目前为止最让我兴奋的Agent框架。不是因为NVIDIA的名头,而是它的设计思路——终于有人把Agent当成普通代码来写了。

一个Python类就是一个Agent

NOOA的核心创新一句话就能说清楚:一个Agent就是一个Python类。方法就是动作,字段就是状态,docstring就是提示词。没了。

以前写Agent是什么体验?你要拼一堆Prompt模板、搭回调图、管理工具注册表、调试看不见的状态流转。代码和提示词混在一起,出了问题都不知道是模型犯傻还是你的逻辑有bug。NOOA把这些全简化了——你定义一个类,LLM觉得方法体该是什么就自动补全什么,正常的Python方法就正常执行。

说人话:你写Agent的过程,和你写一个普通Python项目的过程,几乎一模一样。这个设计思路我特别喜欢,因为它解决了一个根本问题——Agent代码的"可测试性"。

跑了个分,alpha版本就这么猛

NOOA目前是v0.0.8 alpha,但它的基准测试成绩已经让很多老框架坐不住了。

SWE-bench Verified 82.2%。这不是"还可以"的水平——这个成绩意味着它在真实软件工程任务上的通过率超过了大多数开源方案。CyberGym L1 86.8%,这是信息安全攻防任务的分数。ARC-AGI-3 85.1%,这个抽象的推理基准它也没落下。

一个alpha版本的框架,三个不同的基准测试全部80%以上,这已经不是"有潜力"了,这是"上来就干"。

模型无关,pip install就能跑

NOOA通过LiteLLM做模型适配,意味着你可以用任何你喜欢的模型——OpenAI的、Anthropic的、本地的、国产的,都不挑。安装就一行:pip install nooa。要求Python 3.12或3.13。

这一点很关键。很多Agent框架号称"模型无关",但实际上对某些模型的支持是二等公民。NOOA用LiteLLM这个已经很成熟的中间层,等于站在巨人的肩膀上解决了兼容性问题。

有个重要的安全警告

NVIDIA在README里专门写了一条醒目的安全提醒:AST检查不是真正的沙箱隔离。NOOA的方法体是由LLM生成的代码,如果你在本地直接跑,它理论上可以做任何Python能做的事。官方建议:永远在容器或虚拟机里运行NOOA Agent,或者用NVIDIA的OpenShell。

这话说得实在。很多Agent框架都在吹自己的"安全沙箱",但AST级别的静态检查根本拦不住一个有恶意的代码。NVIDIA直接说"我们只是alpha,别在生产环境裸奔",这种坦诚反而让我觉得靠谱。

Agent开发的范式在变

NOOA让我兴奋的不只是技术指标,而是它代表的方向:Agent开发正在从"Prompt工程"向"软件工程"迁移。

过去两年,Agent框架层出不穷,但大多数都陷入了同一个泥潭——你花了80%的时间调Prompt,20%的时间写逻辑。NOOA把这个比例反过来了。你把Agent当代码写,LLM帮你补全不确定的部分。这种分工才是对的:人类负责架构和确定性逻辑,AI负责模糊推理和生成。

当然,alpha版本还有很多不完善的地方。文档还不够全,生态还在早期,生产部署的坑还没人踩。但对于开发者来说,NOOA的核心理念——Agent即代码——值得认真关注。我已经装上了,这周会跑几个真实任务试试。踩过的坑后面会继续分享。

版权声明:
作者:代码杰哥
链接:https://www.aiddithome.com/p/1d36e8b4a87b8e.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
5条评论
熵熵
1楼 · 20小时前

所以以后写Agent就像写普通Python类了?那我是不是可以说"我写了个AI,但其实就写了个class"?

硅谷子
2楼 · 20小时前

这个框架设计思路确实有意思。Agent开发从"调Prompt"进化到"写代码",本质上是在降低工程化的门槛。不过我更关注的是,当Agent框架标准化之后,竞争会从框架层转移到什么层面?数据飞轮?还是场景理解?

算法老K
3楼 · 20小时前

看了下代码,方法体用...占位让LLM自动补全这个设计很巧妙,但实际生产中"什么该让AI补"、"什么该写死"是个大问题。alpha版本三个基准都80%+确实猛,坐等代码杰哥的踩坑报告?

Prompt工程师小林
4楼 · 20小时前

我等这一天等了两年? 每次调Agent的Prompt都觉得自己像个文案策划而不是程序员。NOOA把Agent当类写,终于可以单元测试了,这才是正经工程师该干的事。

诸葛量
5楼 · 20小时前

数据来了:SWE-bench 82.2%意味着在真实代码修复任务上,NOOA已经超过了大部分初级开发者的通过率(通常60-70%)。但这里的watermark是要在容器里跑——安全边界比性能指标更值得关注。