9月10日,英伟达研究团队在《Science Robotics》上发了篇论文,讲人形机器人的运动控制,名字叫SONIC。先说结论:这东西要解决的,是机器人“小脑”太碎的问题。
一个动作一个控制器,这路子走不通
现在人形机器人有个挺别扭的现状:走一个动作,训一个控制器。走路的、抓东西的、上楼梯的,各训各的。一台机器人身上挂着一堆策略模型,互相还得协调。这不只是丑,是根本没法规模化。
英伟达研究员Yuke Zhu的原话,我翻译一下:人形机器人本该像人一样协调地动,但今天的系统是一个技能配一个控制器,扩展性太差。所以他们想验证一件事——一个控制器,能不能撑起全身各种动作。
1亿帧人类动作,喂出一个通用底座
SONIC的思路,是把“怎么动”做成一个通用底层模型。它用超过1亿帧人类动作数据训练,学的不是某个具体动作,而是动作背后的通用规律——平衡怎么保持、重心怎么转移、四肢怎么配合。
这个跟大语言模型一个逻辑:不是背题,是学“语言”本身。SONIC学的,是“运动”这门语言的语法。
VR、视频、大模型,三种指令通吃
最让我觉得有意思的,是SONIC的“万能接口”。你戴VR手套遥操作,它能接;给它一段人类动作视频,它能学;上层再挂一个视觉-语言-动作模型,它也能执行。三种完全不同的指令源,共用同一个底层控制器,不用为每种输入重新训练。
这相当于把机器人的“运动层”给标准化了。以后上层AI只管想,底层SONIC管动。
真机上能跑,但离下厂还差几步
论文里,SONIC先在物理仿真里跑了大量场景,又在一台真机上验证,能复现训练过、甚至训练集里没出现过的动作。但别急着吹。
它现在还不是能直接下工厂的成熟产品。环境感知、碰撞规避、崎岖地形、复杂接触操作,这些都是后面要啃的硬骨头。英伟达的规划,是把SONIC和它的Isaac GR00T平台整合,让上层大模型负责推理,SONIC负责把推理变成稳定可靠的物理动作。
最后说两句
对开发者来说,SONIC的意义不是又多了个炫技demo,而是给人形机器人提供了一个可复用的运动底座。过去每家都得自己造轮子,现在可能有个通用“发动机”能拿来用了。
这条路要是走通,造机器人的门槛会低一截。真正难的,还是从仿真到真实世界的最后一公里。
1亿帧这个量级有意思。数据规模上去之后,泛化能力明显强了,连训练集外的动作都能复现。这说明具身智能也在走“大力出奇迹”的路线。
这思路跟大模型预训练完全一个逻辑,先在海量数据上学通识,再针对任务微调。机器人运动控制要是真能走上“预训练+通用底座”这条路,各家就都不用从零造轮子了。不过sim2real的gap还是老大难,真机上能稳定跑才算数。
一个控制器通吃所有动作,跟一个模型通吃所有语言,本质是不是同一件事?都在追求“通用”。但你真的懂“通用”意味着什么吗?意味着机器人开始有自己的“运动直觉”了。
机器人学会1亿帧动作,那它会不会也学会人类那种“要摔了先伸手撑一下”的本能反应??
我关心的是它到底开不开源。要是只发论文不给权重,对普通开发者就是看个热闹。能跑起来才算数。