9月10日下午,宇树科技又甩了个重磅出来——把新一代通用人形机器人基础模型 UnifoLM-WLA-1.0 完全开源了。注意,不是发论文,不是放演示视频,是"完全开源"这四个字。这在具身智能圈子里,分量不轻。
一套模型,干64种活
这个模型参数量60亿,走的是VLA(视觉-语言-动作)路线。宇树用它做了件挺反直觉的事:把桌面精细操作和全身移动操作,塞进同一个模型里。官方给的数字是,单模型能跑64项任务——10项全身操作(倒垃圾、把衣服塞进洗衣机、整理鞋子、收拾浴室厨房、铺床),加上54项桌面操作(叠毛巾、叠衣服、收纳餐盘、给电池充电)。
以前做机器人操作,桌面抓取和全身移动通常是两条线分开训,各管各的。宇树这次用统一动作空间,把手臂、末端执行器、下半身关节都拆成离散Token,让它们在一个模型里学协同。这个思路不复杂,但要做到"一个checkpoint跑全部",工程上挺费劲。
它凭什么说"理解世界"
更让我在意的是它那套机制。UnifoLM-WLA-1.0 不止是"看到就做",它先要预测"我这一下动完,画面里哪块会变"。宇树管这叫 Dynamic Region,用光流从前后视频帧里提取变化区域,再压成离散Token。翻译成人话就是:机器人在动手之前,先在心里推演一下"我推这个餐盘,哪里会空出来",再生成动作。这套"先想后果再动手"的逻辑,比单纯模仿动作数据靠谱得多。
它的具身推理部分 UnifoLM-ER-1-4B,是基于 Qwen3-VL-4B 训的,塞了超过500万份具身推理样本。宇树公布的成绩单里,它在 RefSpatial-Bench、Where2Place、PixMo-Point 等7项开源评测里拿了第一,部分空间理解任务还超过了 GPT-6 Astra。比如 Where2Place 82.0分,比 GPT-6 Astra 高出13分。
数据从哪来,能不能复现
训练用的是约2500小时高质量真机数据,包含宇树自有的开源数据和 BitRobot-HIW-500 这类公开数据集。真机数据这东西很贵,2500小时不是小数目。不过有个细节得泼点冷水:官网的 Code、Models、Datasets 现在还写着 Coming soon,权重和训练配方还没真正放出来。也就是说,"完全开源"的承诺落地了,但离开发者能直接下载复现,还差最后一公里。
为什么这步棋值得盯
宇树8月19日刚在科创板上市,是A股首家人形机器人公司,累计生产了约18000台双足机器人,硬件出货量已经是全球第一梯队。现在它把最核心的"大脑"也开源,逻辑其实很清楚:硬件赚的是当下,生态赚的是未来。把模型权重和训练配方放出来,等于拉更多开发者和本体厂商站到自己这条技术路线上,久而久之就是事实标准。
对普通开发者来说,这也意味着人形机器人的"大脑"不再是大厂专属,小团队也能站在开源基座上去改。最后说一句:开源不是慈善,是战略。宇树这步,短期看是让利,长期看是在给具身智能定"操作系统"。
空间理解超过GPT-6 Astra那几个分,其实比64种活更值得盯。通用大模型杀进物理世界,专用具身模型怎么守,这是未来一年的主线。
宇树这步棋很聪明。硬件已经是出货量第一了,现在把大脑也开源,等于把生态护城河从卖机器换成了定标准。
机器人叠毛巾、倒垃圾、铺床……这不就是请了个全能家务搭子吗?啥时候能帮我收拾浴室啊?
我最关心的还是开源两个字。官网现在Code、Models、Datasets还写着Coming soon,等权重真放出来,能不能在G1之外的本体上跑通才是真考验。
先说结论,2500小时真机数据加60亿参数,把桌面和全身操作塞进一个模型,这条路是对的。分开训的模型一换本体就废,统一动作空间才能泛化。