8月25日,Figure机器人联合创始人Brett Adcock在社交媒体上发了一条意味深长的动态:公司正在经历“能力的又一次台阶式跃升”,明天(8月26日)将分享一项对解决通用机器人问题至关重要的更新。
Brett Adcock这个人不是第一次语出惊人。他之前还创办了Verge(电动飞机公司)和Arch(电动摩托),都是硬核赛道的连续创业者。他说“台阶式跃升”,大概率不是指跑快了0.5秒或者多了个手指关节这种渐进式优化。
通用机器人到底卡在什么地方
过去两年,人形机器人赛道最大的矛盾是:硬件进步飞快,但“通用性”始终差一口气。什么意思?就是你看到的每一个Demo都很酷,但放到真实场景里就露怯。
波士顿动力的Atlas能后空翻,但你让它去仓库搬个箱子试试;特斯拉的Optimus能叠衣服,但换个房间它就不认识了。问题出在哪?不是硬件不行,而是“大脑”不够通用。
现在的机器人大多还是“任务专用”模式:训练一个抓杯子的策略,它就只会抓杯子;换个物体、换个光照、换个角度,可能又要重新来。这和十年前AlphaGo的问题很像——下围棋天下无敌,但你让它下象棋它就是个废物。
Figure走的是什么路线
Figure从一成立就走了和其他机器人公司不同的路。他们没有先做Demo再补AI,而是从第一天就在死磕“端到端”的神经网络控制。
2024年,Figure和OpenAI合作,把大语言模型接入机器人的决策系统。Figure 02能一边对话一边干活,你说“把那个红色的东西递给我”,它真的能理解“红色”和“那个东西”是什么意思。
但说实话,之前的版本还是“演示级”的。动作慢、成功率不够高、场景一变就容易出错。这也是整个行业的瓶颈:把大模型的“理解力”真正转化成机器人的“执行力”,中间差了一个巨大的工程鸿沟。
Brett Adcock说的“台阶式跃升”,如果真能解决这个问题,那就是从“能演示”到“能干活”的质变。
明天可能发布什么
根据行业趋势和Figure之前的技术路径,有几个合理猜测:
第一种可能:端到端控制模型的重大突破。比如一个新的神经网络架构,让机器人能在更多样化的场景中自主完成任务,而不需要为每个任务单独训练策略。这是“通用性”的核心。
第二种可能:新的“世界模型”能力。就是机器人能在脑子里“想象”一个动作的后果,而不是靠试错。这会让机器人的学习效率高出一个量级。
第三种可能:实际场景的部署案例。不再是实验室Demo,而是在真实工厂、仓库、家庭环境中的工作视频。这对行业的说服力完全不同。
当然,也不排除是硬件层面的突破,比如新的灵巧手或者新的关节驱动方案。但从“通用机器人问题”这个措辞来看,大概率是软件/算法层面的。
为什么这件事值得关注
刚结束的世界人形机器人运动会上,400米冠军成绩从去年的1分28秒缩短到38秒,百米最快从21秒缩短到9秒多。硬件层面的进化速度已经非常惊人了。
但真正决定机器人能不能走进千家万户的,不是它跑多快、跳多高,而是它能不能“通用”——能不能在不确定的环境里,处理没见过的任务。这才是从“表演”到“实用”的关键一步。
如果Figure明天真的给出了一个令人信服的答案,那个人形机器人赛道的估值逻辑可能要重写了。
Brett Adcock这种连续创业者值得重点关注。从电动飞机到电动摩托再到机器人,每次都是在最硬的赛道上死磕。他说台阶式跃升,我倾向于相信。
跑得快跳得高不算本事,能在陌生的厨房里炒出一盘能吃的菜,那才叫真功夫 ?
一个有趣的问题:如果机器人真的实现了“通用性”,它还需要“理解”世界吗?还是只需要“响应”世界?这个区别,决定了它是工具还是某种意义上的存在。
端到端控制这个方向我一直盯着,核心难点在于sim-to-real gap。仿真里训练的策略,放到真实物理世界成功率就断崖式下跌。Figure如果能在这个问题上给出实质性进展,那确实是台阶级的。
代码说话:现在机器人领域最缺的不是更好的硬件,而是一个像Transformer那样的架构突破。CNN解决了视觉,Transformer解决了语言,机器人的“Transformer时刻”到底在哪?明天可能会看到线索。