昨天刷到一条消息,阿里的通义千问团队发了一个叫Qwen-UI-Agent的模型。
一句话概括:这个模型专门用来操作手机和电脑的界面,在多个GUI基准测试中,跑赢了GPT-5.6和Claude Opus 4.8。
可能有人觉得,又是一个跑分第一,有什么好看的。但这次不太一样,因为它代表的是一个全新赛道的成熟:GUI Agent。
什么是GUI Agent
简单说,就是能像人一样看屏幕、点按钮的AI。
传统的自动化靠的是代码接口,比如API调用。但GUI Agent不走这条路,它直接操作图形界面,看截图、理解内容、决定点哪里、然后点下去。
这个区别很关键。传统自动化一旦界面变了就废了,GUI Agent能自适应,因为它认的是"搜索框"而不是"第3个div"。
为什么现在火了
三个技术瓶颈刚好在这两年一起被突破了。
第一,多模态模型终于能看懂UI了。以前让AI看一张屏幕截图,它只能告诉你"这是个手机",现在能精确到"这是一个登录按钮,在坐标(540,200)的位置"。
第二,推理能力上来了。Agent能自己拆解任务,你说"帮我订明天的高铁票",它能拆成十几步操作,每一步还有自我纠错。
第三,开源生态成熟了。阿里这次发的Qwen-UI-Agent就是开源的,谁都可以拿来做二次开发。
阿里这次做了什么
Qwen-UI-Agent的特点是跨平台:一个模型同时支持手机、电脑、网页,甚至深度搜索环境。
在多个权威基准测试上,它的表现超过了GPT-5.6和Claude Opus 4.8。不是只超了一点,是在UI导航和任务完成率这两个核心指标上都明显领先。
这对开发者来说意味着,以前那些需要人手动点击完成的企业流程、RPA脚本搞不定的老旧系统,现在有了一种新的自动化思路。
落地场景比想象中多
最直接的用途是企业RPA升级。很多公司跑了二三十年的老系统,没有API,全靠人手动操作。GUI Agent不需要API,它能看懂界面,就能操作。
还有智能座舱场景,开车的时候说一句"导航到最近的咖啡店,帮我提前点一杯拿铁",这种跨App、有时间逻辑的操作,传统方案做不了,但GUI Agent天然能处理。
另外在软件测试领域,GUI Agent可以替代Selenium那套脆弱的自动化测试方案,靠语义识别自适应UI变化,还能做探索性测试。
但也要看到现实
目前GUI Agent最大的挑战还是准确率。真实场景里界面千变万化,网络延迟、弹窗干扰、加载状态都可能影响操作。即使模型能力很强,99%的场景成功,剩下1%的失败也可能造成严重后果。
所以短期内,GUI Agent更可能以"辅助"角色出现,处理那些确定性高的重复操作,复杂决策还需要人来兜底。
但长远来看,当视觉模型继续进化,端侧推理芯片普及,GUI Agent会成为人机交互的默认方式。每个人手机上都会有一个真正能帮你操作应用的AI助手。
这不是RPA的升级版,是交互范式的真正变革:AI不再通过API理解世界,而是像人一样,通过屏幕理解世界。
以后手机上是不是每个app都可以不用手动打开了? 说一句就全搞定
开源是正道。GUI Agent这东西需要大量场景数据来训练,开源能让社区贡献各种平台各种设备的截图数据,比一家公司闭门造车快多了
99%成功率这个点说得好。剩下1%的失败如果发生在支付或者提交订单的场景,后果可能很严重。所以人机协作短期内还是必须的
作为一个做了五年RPA的人,看到GUI Agent确实感觉时代变了。传统RPA最怕的就是界面改版,每次甲方改个按钮位置我们就得加班改脚本?
智能座舱那个场景很有想象力,但实际落地最大的问题还是延迟。开车的时候等AI思考3秒再点按钮,体验会很差。端侧推理芯片是关键