提到具身智能最大的坎,业内几乎都会回答同一个词:泛化。什么叫泛化?就是让机器人在一个它从没见过的环境里,也能把活儿干利落。最近美国机器人公司Figure,专门拿这个当考题出了一次题。
当地时间9月17日,Figure公布了新一代神经网络模型Helix 2.5在泛化学习上的进展。这回他们做了一个有点"较真"的实验:租赁了30套普通住宅,没有提前采集、没有预先训练,让机器人直接进到完全陌生的客厅、卧室里干活。
干的是什么活
演示里的场景很日常:在陌生的客厅里打扫和整理,从一堆东西里把毛巾叠好放回原位,把床铺整整齐齐地铺好。这些对人有手就行的事,放到机器人身上,就是一道需要层层拆解的难题。
难点在于,家里没有标准产线那样规规矩矩的工位,椅子高矮不齐、东西随手乱放、光照角度每天都在变。机器人要在这种"不可预测"里,靠自己看清环境、判断意图、再决定下一步动作。
为什么这事值得关注
回顾Figure的路线能看出它的思路。2025年2月,Figure推出Helix端到端具身模型,第一次把"视觉-语言-动作"这套VLA框架用在人形机器人上,让机器人的学习能力和肢体控制连成一坨。
2026年1月,Figure发布Helix 02,采用"System 0-2"三级架构,分别处理底层反射运动、运动控制、以及语言和场景理解。到5月,搭载Helix系统的Figure 03已经能在包裹分拣流水线上连续工作超过200个小时。
从封闭流水线,到开放陌生住宅,这一步的本质区别,是机器人从"背答案"走向了"陌生题也敢碰"。Helix 2.5要解决的,正是这个泛化难题。
泛化到底难在哪
说白了,深度学习模型在训练过的场景里表现优异没什么稀奇,难的是它能不能把能力迁移到从没见过的地方。Figure这次选择30套真实住宅做主战场,等于主动放弃了"环境固定"这个保险。
但也要泼一盆冷水:30套住宅仍然是相对可控的测试样本,距离真实家庭里那种"犄角旮旯堆满杂物、老人孩子来回走动"的极端复杂度,还有不小距离。叠毛巾、铺床这类任务相对结构化,真要覆盖洗碗、收纳这种千变万化的家务,还有很长的路。
写在最后
Figure的Helix 2.5,往小了看是自家模型的一次迭代,往大了看,是具身智能从"会特定几招"向"会随机应变"迈进的缩影。
当机器人在陌生房间里能自己判断该叠毛巾还是铺床,具身智能离"进家"这个方向,就又近了一小步。泛化这道题没有捷径,只能拿真实场景和数据一层层去磨。谁先磨透,谁就占住了下一波市场的身位。
从封闭流水线到开放住宅,本质是从背答案到敢碰陌生题。泛化没有捷径,只能靠真实场景数据一层层磨,30套样本只是开始,不是终局。
VLA从看得懂到干得稳,最难得的是陌生环境直接上手。但30套住宅还是偏理想化,真像家里那种随手乱放的杂物,还得看后续数据。
扫地叠毛巾都行,那家务是不是真要解放了?可一转念它要是碰坏东西、夹到手怎么办,安全还是得放第一位。
泛化一直是具身智能最难啃的骨头。Figure用完全陌生的住宅测试叠毛巾铺床,等于把'不可预测的环境'当考题,这个实验设计比刷分更有含金量。不过真要说家用,复杂度还远不够。
机器人会叠毛巾了,那它知道我叠成什么样才叫好呢?叠到一半会崩溃吗?