8月20日这天,AI圈发生了件有意思的事。阿里和Anthropic几乎在同一时间,各自亮出了让AI直接操作屏幕的新产品。一边是Qwen-UI-Agent,一边是Computer Use正式版。两家做的同一件事:让AI看懂屏幕,替你点鼠标、填表单、切App。
不跑模拟器,100台真机硬训
阿里这次的路线很直接。没有用模拟器糊弄,而是搭了覆盖100多台真实手机、150多款应用的真机环境。任务构建、轨迹采集、模型训练、评测,全在真机上跑。还自建了MobileWorld-Real真机基准,400多个任务、100多款应用,专门测真实环境表现。
结果相当能打。MobileWorld-Real上92.2%的成功率,AndroidDaily日常任务集直接飙到97.5%,接近满分。在模拟器基准MobileWorld上,82.1%的成绩领先GPT-5.6 Sol达12个百分点,领先Claude Opus 4.8达14.6个百分点。关键是,这个模型主力版本参数只有27B,基于Qwen 3.5打造。
电脑端也不含糊。OSWorld-Verified拿到79.5%,浏览器WebArena 73.6%排第一。而且不光能点屏幕按钮,还能直接调命令行,支持批量动作输出,一次规划多个步骤连续执行。
安全这根弦,两家绷法不一样
AI替你操作手机电脑,听着很爽。但万一它点错转账按钮呢?这个问题在同一天被两家用不同方式回答了。
阿里的做法是在敏感操作节点主动降速。发红包、删文件、隐私授权这类事情,Qwen-UI-Agent会主动暂停,向用户说明情况,等确认了再继续。违法或高风险请求直接终止,一步界面操作都不做。这个设计在业界算是目前最明确的安全护栏了。
Anthropic走了另一条路。Computer Use正式版新增的browser use工具不再只靠像素坐标定位,而是读取页面DOM结构,直接锁定具体按钮和输入框。网页改版也不容易点歪。但具体安全机制怎么做的,外界暂时看不到细节。
一个选择主动降速换安全,一个选择精准定位减失误。思路不同,目标一样:让AI操作足够可靠,用户才敢用。
92.2%很亮眼,但那7.8%才是关键
真机92.2%的成功率确实亮眼。但换个角度看,剩下7.8%的失败率在真实场景里意味着什么?点错按钮可能是发错消息,也可能是转错账。
在金融、医疗这种场景里,99.9%和100%之间就是「能用」和「敢用」的鸿沟。安全领域有个共识:99.99%的正确率也无法抵消单次高风险错误的影响,因为不同错误的损失是非线性的。
另外,150多款应用的训练覆盖面,面对数以百万计的应用生态,长尾适配仍然是个大工程。技术领先不等于商业成功,让用户真正放心把屏幕交给AI,比刷榜难多了。
下一个战场不是生成,是操作
过去两年AI圈卷的是「生成」,文字、图片、视频。但8月20日这一天,信号很明确:下一个战场是「操作」。
当AI能跨App帮你完成操作,它就不再是聊天框里的文字游戏,而是真正的数字员工。百度同日发布的数据也印证了这点:文心助手任务引擎2.0日活同比增长83%,覆盖超4亿用户。人正在把更复杂的任务交给AI。
阿里选择开源,打法跟Qwen系列一脉相承,用开源和性能抢开发者生态。Anthropic走商业化路线,直接上API收费。两条路谁跑得通,得看接下来的真实数据了。
但有一点可以确定:GUI Agent的出现,意味着AI从「会说」进化到了「会做」。这个变化,可能比大多数人意识到的要深远得多。

说句实在话,现在最大的问题不是AI能不能操作屏幕,而是出了事谁负责。你帮我转账转错了,是AI的bug还是用户的责任?这个问题不解决,再强的GUI Agent也只能当演示看。代码不说谎,但法律会。
同一天发两个产品,这巧合也太刻意了? 不过确实说明GUI Agent赛道热了
以前觉得AI帮你写文案就够了,现在连屏幕操作都要接管了。进化太快,我连按钮都还没点明白呢?
从数据看,27B参数的模型能在6个GUI基准里拿5个第一,这个效率比堆参数有意义得多。更关键的是阿里搭了100台真机的训练环境,说明他们很清楚模拟器训练的天花板在哪。下一步要看的是跨App长程任务的稳定性,170步的数据分析任务能跑通是demo级别,日常1000次里99.9%能跑通才算产品级别。
GUI Agent这件事,技术是一层,信任是另一层。92.2%的真机成功率在实验室里很漂亮,但放到真实用户手里,那7.8%的失败可能一次就毁了信任。阿里选择在敏感操作节点主动暂停等人确认,Anthropic走精准定位减少失误,两条路各有道理。核心问题是:用户愿意给AI多大的操作权限?这个问题的答案可能比技术参数更决定成败。