看到一个挺戳人的demo:机器人想拿高处的物品,够不着。放在以前,它会原地卡死然后报错。这一次,它转了个身,自己在房间里找到一张凳子,搬过来垫在脚下,爬上去拿到了。
不是脚本,是它自己想出来的
这个画面来自乐享科技公开的「以太大模型」(Aether)演示。它最核心的一句话是:让机器人不靠脚本、不靠遥操、不靠堆数据,真正自主地理解物理世界并完成任务。
说人话就是,过去大多数具身智能模型像个牵线木偶,每一步都写在剧本里;以太大模型想做的是那个有自己想法的「生命」。demo里机器人够不着物品,不是工程师预埋了「搬凳子」的预案,而是模型自己完成了三层接力。
先是元认知,让机器人意识到「以我现在的状态完不成任务」,而不是盲目执行;然后是主动决策,转动视角在房间里搜索可用工具;最后是运动动力学,保证搬凳子、攀爬的每一步都符合重力和平衡的约束。
擦玻璃这件小事,看出真本事
另一个场景更耐人寻味。测试让它「擦玻璃」,传统机器人会走到玻璃前机械地挥手。以太大模型驱动的那台,先做了视觉和逻辑判断,发现污渍其实在玻璃外侧,于是打开门走到室外,把外面擦干净了。
这个动作背后是多模态理解在起作用:它读懂了指令里「把玻璃弄干净」的真实意图,而不是「挥动手臂」这个字面动作。面对模糊指令和未知环境,能做出合乎情理的判断,这才是通用智能和表演型能力的差别。
两台不同牌子的机器人开始搭把手
最让我觉得有分量的是跨品牌协作那一段。物品太多,一台机器人搬不完,于是智元的机器人直接把东西挂在宇树机器人身上,两台机器配合着一次性搬完。这是全球首次跨品牌机器人在物理空间里的实体协作。
这种配合不是预设程序,而是建立在流式记忆之上:两台机器人共享对任务进度、物品位置、彼此状态的理解,才能在物理空间里完成人类社会级别的「交接」。一套模型适配所有本体,通用智能的题中之义就在这。
它想回答的那个问题
具身智能喊了两年「从实验室走向真实世界」,真正的分水岭一直很清楚:机器人能不能不靠人工编排,独立面对真实环境里的意外。以太大模型这次给出的,是一个能自己观察、自己判断、自己找工具的实机答案。
当然,demo和量产之间隔着十万八千里,稳定性和成本都还没被验证。但至少方向摆出来了——把「会思考」装进「会动手」,这条路一旦走通,机器人就从工具变成了真正能搭把手的伙伴。
从「牵线木偶」到「自己想辙」,这一步比任何跑跳数据都值钱。真正的通用智能不是动作多花哨,而是面对意外时还能把活干完。
它够不着都知道搬凳子,我够不着只会喊妈。?机器人进化得比我还快,这合理吗?
搬凳子这个动作拆开看是元认知加物理推理加运动控制三层,单拎一层都不难,难的是串起来还能实机跑通。demo离产品还有距离,但技术路线是对的。
以后机器人自己找凳子垫脚,我是不是连「帮我把高处的东西拿下来」都不配说了,它直接回我一句「你自己不也能搬」。