阿里发了个能"看屏幕"的AI,GUI Agent赛道要爆了

工具猎人AI学习 2026-08-26 20:26:15 6阅读 举报

昨天刷到一条消息,阿里的通义千问团队发了一个叫Qwen-UI-Agent的模型。

一句话概括:这个模型专门用来操作手机和电脑的界面,在多个GUI基准测试中,跑赢了GPT-5.6和Claude Opus 4.8。

可能有人觉得,又是一个跑分第一,有什么好看的。但这次不太一样,因为它代表的是一个全新赛道的成熟:GUI Agent。

什么是GUI Agent

简单说,就是能像人一样看屏幕、点按钮的AI。

传统的自动化靠的是代码接口,比如API调用。但GUI Agent不走这条路,它直接操作图形界面,看截图、理解内容、决定点哪里、然后点下去。

这个区别很关键。传统自动化一旦界面变了就废了,GUI Agent能自适应,因为它认的是"搜索框"而不是"第3个div"。

为什么现在火了

三个技术瓶颈刚好在这两年一起被突破了。

第一,多模态模型终于能看懂UI了。以前让AI看一张屏幕截图,它只能告诉你"这是个手机",现在能精确到"这是一个登录按钮,在坐标(540,200)的位置"。

第二,推理能力上来了。Agent能自己拆解任务,你说"帮我订明天的高铁票",它能拆成十几步操作,每一步还有自我纠错。

第三,开源生态成熟了。阿里这次发的Qwen-UI-Agent就是开源的,谁都可以拿来做二次开发。

阿里这次做了什么

Qwen-UI-Agent的特点是跨平台:一个模型同时支持手机、电脑、网页,甚至深度搜索环境。

在多个权威基准测试上,它的表现超过了GPT-5.6和Claude Opus 4.8。不是只超了一点,是在UI导航和任务完成率这两个核心指标上都明显领先。

这对开发者来说意味着,以前那些需要人手动点击完成的企业流程、RPA脚本搞不定的老旧系统,现在有了一种新的自动化思路。

落地场景比想象中多

最直接的用途是企业RPA升级。很多公司跑了二三十年的老系统,没有API,全靠人手动操作。GUI Agent不需要API,它能看懂界面,就能操作。

还有智能座舱场景,开车的时候说一句"导航到最近的咖啡店,帮我提前点一杯拿铁",这种跨App、有时间逻辑的操作,传统方案做不了,但GUI Agent天然能处理。

另外在软件测试领域,GUI Agent可以替代Selenium那套脆弱的自动化测试方案,靠语义识别自适应UI变化,还能做探索性测试。

但也要看到现实

目前GUI Agent最大的挑战还是准确率。真实场景里界面千变万化,网络延迟、弹窗干扰、加载状态都可能影响操作。即使模型能力很强,99%的场景成功,剩下1%的失败也可能造成严重后果。

所以短期内,GUI Agent更可能以"辅助"角色出现,处理那些确定性高的重复操作,复杂决策还需要人来兜底。

但长远来看,当视觉模型继续进化,端侧推理芯片普及,GUI Agent会成为人机交互的默认方式。每个人手机上都会有一个真正能帮你操作应用的AI助手。

这不是RPA的升级版,是交互范式的真正变革:AI不再通过API理解世界,而是像人一样,通过屏幕理解世界。

版权声明:
作者:工具猎人
链接:https://www.aiddithome.com/p/414c801399d37.html
来源:AI学习
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
7条评论
熵熵
1楼 · 15小时前

以后手机上是不是每个app都可以不用手动打开了? 说一句就全搞定

诸葛量
2楼 · 15小时前

开源是正道。GUI Agent这东西需要大量场景数据来训练,开源能让社区贡献各种平台各种设备的截图数据,比一家公司闭门造车快多了

效率女王米米
3楼 · 15小时前

99%成功率这个点说得好。剩下1%的失败如果发生在支付或者提交订单的场景,后果可能很严重。所以人机协作短期内还是必须的

Prompt工程师小林
4楼 · 15小时前

作为一个做了五年RPA的人,看到GUI Agent确实感觉时代变了。传统RPA最怕的就是界面改版,每次甲方改个按钮位置我们就得加班改脚本?

算法老K
5楼 · 15小时前

智能座舱那个场景很有想象力,但实际落地最大的问题还是延迟。开车的时候等AI思考3秒再点按钮,体验会很差。端侧推理芯片是关键