这两天机器人圈被一个名字刷了屏:中国科学院的具身智能大模型"麦克斯韦(Maxwell)",在机器人操作权威基准测试Meta-World上拿下91.9分,登顶全球第一,把谷歌DeepMind、MIT、丰田研究院内行人的分数全比了下去。
Meta-World,比的是"干活"不是"说话"
这个基准测的不是模型能聊得多好,而是机器人真会干活。它涵盖开门、拉抽屉、抓取物体、工具操作等50种贴近日常和工业的精细物理操作。和传统工业机器人照着固定坐标机械重复不同,具身智能要求实时理解三维空间关系,并根据接触到的阻力和摩擦主动调整关节。麦克斯韦在Meta-World拿到91.9分,刷新的正是这一项的历史纪录。
干掉DeepMind和MIT的是谁
麦克斯韦由中科院下属的工业人工智能研究院独立研发。它力压谷歌的"物理智能"团队、丰田研究院、MIT、卡内基梅隆等全球顶尖机构拿下头名。第二名是深圳优艾智合Youibot的FabriVLA(90分),第三是韩国庆北大学的SUREFlow(88.3分)。光从榜单格局就能看出,具身智能"大脑"的竞争已经全面白热化。
两个数字最亮眼:200多项任务、99.1%成功率
官方数据里最扎眼的是两条。一是无需任何额外微调(fine-tuning),麦克斯韦就能一次性理解并完成200多种物理操作;二是在LIBERO模拟环境中,它完成"开气灶→放水壶""抓杯→放微波炉→关门"这类连续多步复合任务的整体成功率达到99.1%,上下文记忆和任务衔接能力相当强。
10亿参数,单个GPU就能跑
真正的杀手锏还在后头。麦克斯韦只有约10亿参数,走"轻量化+边缘部署"路线,跑得动单个GPU甚至端侧设备,不必依赖云端数据中心。这对把具身智能"大脑"塞进宇树这类国产机器人机身是很关键的一步——中国机器人阵营补齐"AI大脑"的速度会明显加快。
为什么这事值得关注
早在2026世界机器人大会上,宇树创始人王兴兴就说过,具身智能真正爆发的临界点,在于AI模型能否精准匹配真实物理世界,解决那"几毫米的误差"。麦克斯韦在物理操作基准上登顶,正是国产大模型从"会写会说"走到"会干活"的一个信号。大模型的主战场,正从数字世界转向物理世界,这已经是一场新竞赛。
总结
中科院麦克斯韦在Meta-World登顶,短期看是一条技术新闻,长期看则是具身智能"大脑"话语权转移的注脚。当能用单个GPU跑、无需微调就能干活的大模型越来越多,机器人从"花架子"变"真会干"的日子,可能比想象中来得快。普通人想入局具身智能,多盯这类"大脑"进展,比反复追一两款产品更接近本质。
10亿参数能单GPU跑这点太关键了,说明不是堆算力堆出来的,是算法真扎实。以后塞进机器人机身做片上推理,落地速度会快很多。
99.1%的连续任务成功率确实夸张,多步骤的上下文记忆最难做,能做到这个水平说明工程能力和数据都到位了。
王兴兴说的几毫米误差那个点,跟这篇对上了。能干活的大模型才是机器人落地的真瓶颈,光会表演迟早要被淘汰。
从会写会说进化到会干活,这个判断我认。国产大模型转战物理世界的信号越来越明显了,方向对了比什么都强。
单看91.9分没概念,但想想这是把谷歌DeepMind和MIT都比下去,含金量就出来了。具身智能的牌桌格局要变了。