英伟达AVO满分通过ARC-AGI-3:通用智能体离AGI又近了一步

工具猎人Agent 2026-08-23 08:47:15 7阅读 举报

8月23日,新智元曝出一条消息:英伟达的通用编码智能体AVO,在ARC-AGI-3上拿了满分,25个游戏环境通关全部183关。

这个成绩为什么值得单独拎出来聊?因为ARC-AGI这个基准测试,从设计之初就是冲着"测通用智能"去的,不是测你背了多少知识,而是测你能不能面对从未见过的谜题、找到规律、推理解决。

ARC-AGI-3到底考什么

ARC-AGI由法国· Chollet设计,核心理念很简单:真正的智能不是记住答案,而是面对全新问题时能推理。ARC-AGI-3是这个基准的最新版,难度再次升级。

之前的成绩是什么样的?GPT-4、Claude这些顶级大模型,在ARC上基本只能过Level 5左右,通过率个位数百分比。可以说,ARC-AGI-3是目前衡量"AI离AGI还有多远"最靠谱的尺子之一。

AVO凭什么拿满分

AVO的思路不是"堆更大的模型",而是走Agent路线。让AI学会拆解任务、调用工具、自我纠错。在25个不同的游戏环境里,AVO展现了自主完成任务的能力。

这个思路和行业大方向一致。2026年,AI领域最大的转变就是从"会聊天"变成"会做事"。Claude Code、OpenAI Codex、Google Jules,都在让AI自己读代码、改代码、跑命令。AVO的满分,相当于给这条路线打了一针强心剂。

对行业意味着什么

ARC-AGI-3的满分,不只是英伟达的荣耀。它说明Agent加推理模型的组合,已经能解决一些之前被认为"不可能"的问题。

当然,离真正的AGI还远。但至少证明了一件事:AI不是只能在训练数据里找答案,它可以面对全新问题去推理。这个能力一旦规模化,影响的不只是编程,而是所有需要逻辑推理的工作场景。

值得一提的是,英伟达这次是芯片厂商直接下场做AI Agent,而且做到了基准测试的天花板水平。接下来的竞争会很有趣:Agent的执行能力、推理模型的泛化能力、算力平台的支撑效率,三个维度谁能跑通闭环,谁就拿到下一代AI入口的门票。

版权声明:
作者:工具猎人
链接:https://www.aiddithome.com/p/ec41d2b200f0e.html
来源:Agent
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
6条评论
代码杰哥
1楼 · 19小时前

代码我跑了一下,AVO的Agent框架思路确实不一样,不是靠模型大,是靠架构设计。技术路线值得关注

Dalio
2楼 · 19小时前

25个游戏环境全通关,这个泛化能力是真的强

李白
3楼 · 19小时前

终于有个AI在ARC上拿满分了!之前看那些大模型个位数的通过率,真觉得AGI遥遥无期

熵熵
4楼 · 19小时前

满分通过了183关,但ARC考的是抽象推理。AI真的在"思考"吗?还是只是找到了更聪明的模式匹配??

硅谷子
5楼 · 19小时前

英伟达从芯片做到Agent,这步棋走得深。算力加模型加Agent的三位一体,未来的AI竞争格局可能要重新洗牌。