前阵子大家都在聊人形机器人能不能进厂、能不能干活,我看都在聊"能不能"。这两天Figure放了个东西,把答案往前推了一大截——它的神经网络模型Helix 2.5,让人形机器人第一次在从没去过的陌生家庭里,零样本学会了整理客厅、叠毛巾、铺床。说人话就是:它没在这户人家提前学过,进去就能上手干。这不只是又一款新品,是"机器人会不会干活"这件事彻底换了个玩法。我研究了两天,把它到底牛在哪、又有啥没说透的,掰开揉碎讲给你听。
零样本三个字,到底意味着什么
先看最核心的:Figure的Helix 2.5在做的事,叫零样本全身自主作业。什么意思?就是机器人进入一个此前完全没接触过的家庭,没有提前采集当地数据、没有做模型微调、也没有针对环境做任何适配,直接执行整理客厅、折叠毛巾、铺床这些任务。
以往要让机器人干点家务,最笨的办法是逐户"喂数据"——先到你家拍一堆照片、标一堆点,它才知道你家沙发长啥样、毛巾该放哪。Helix 2.5直接跳过了这步。用数据说话:在任务数据、模型架构、训练和评估方法都不变的前提下,用Index人类行为数据集做预训练后,零样本任务成功率从9%一路拉到56%。
9%到56%,看着不高,但这是"从几乎不会到能真上手"的质变。你要是养过猫就知道,让一个从没进过你家门的家伙学会帮你收纳,这在过去是想都不敢想的事。
它靠什么做到的:把"看过"和"会做"打通
我能理解很多人第一反应是"这有啥,不就是更多数据么"。但这里的关键不是数据多少,而是模型把"理解环境"和"控制身体"这两件事连起来了。
之前的人形机器人,大多是"看得懂但手脚笨",或者"手脚灵活但不认识你家东西"。Helix 2.5的思路,是先用Index数据集让机器人预训练出对家务的理解——知道什么叫"整理好的客厅"、毛巾应该叠成什么样、铺床先铺哪头。到了新环境,它靠视觉把眼前的东西映射回这些知识,再调动全身去执行。眼睛、脑子、手脚,第一次在一个模型里协同起来了。
这话听起来抽象啊?举个感受例子:你让它收拾客厅,它不会把被子塞进冰箱,也不会把毛巾搭在电视上——因为预训练阶段它已经"见过"大量被收拾好的客厅长什么样。
别急着吹,它也有还没跨过的坎
说得热闹,我也得把另一面摆出来。Helix 2.5目前演示的是整理客厅、叠毛巾、铺床这三类家务,都是在相对规整的静态场景里。真到了"孩子把玩具撒一地、下一秒又跑过来捣乱"这种动态、不可预测的家庭环境,能不能稳得住,还是未知数。
而且56%的成功率,意味着还有将近一半的尝试是失败的。这个数字进普通人家当"家政机器人"还差得远,但对整个人形机器人行业来说,它打开的想象空间很大——如果通用场景的零样本作业能持续往上走,"每家一台能干活的人形机器人"这句口号,才算真正有了技术地基。
对我来说,Helix 2.5最有价值的地方,是把行业从"堆案例"拽回了"学规律"。机器人不是靠背答案记住你家,而是真的靠理解来干活了。这条路,走得对。
总结:这场零样本竞赛,刚刚开始
Figure用Helix 2.5证明了一件事:人形机器人从"展厅里的明星"到"别人家能干活的帮手",中间的坎正在被一点点抹平。接下来就看它能不能把成功率往上推,把场景从一个静态房间拓展到真正混乱的日常。
对我们这些看热闹又盼着真落地的人,这是好信号——当机器人能靠"理解"而不是"死记硬背"干活,离它真正走进生活,就又近了一步。至于那一天是半年还是一年,我们边看边等,别急,方向对了就行。
你确定它叠毛巾是真的'懂'整洁,还是只是把见过的模式套到你身上?人形机器人要想真正进家,'会干活'和'懂生活'之间,还有很长一段路要走。
从模型训练的视角看,这其实暴露了具身智能当前最大的瓶颈不是骨骼也不是电机,而是'怎么把海量感知数据和大模型的能力,压进一个能实时动起来的身体里'。Helix 2.5算是迈了半步,剩下的路还长。
笑死,我怕它进我家第一件事不是叠衣服,是先把我那堆没洗的碗识别成'待整理物品'。技术是好技术,但我家这现场,AI看了都得沉默?
这个9%到56%的对比太关键了。很多人只看到机器人能干家务,没看到背后是'理解环境'模型的突破。零样本能到56%,意味着通用机器人第一次有了'举一反三'的可能,这才是人形机器人真正的分水岭。
它不用提前学就能进你家叠毛巾,那我是不是该赶紧把房间收拾好,免得被机器人发现我的被子是卷成团的??