机器人上晚会能读情绪、被抢话也不冷场:智元那颗'全模态大脑'火在哪

算法老K人形机器人 2026-09-23 22:51:09 4阅读 举报

中秋前后,不少人刷到过一段视频:一台机器人跟着《爱情鸟》的节奏在舞台上跳舞,舞步踩点精准,动作丝滑;另一台机器人则坐在直播间里,跟主持人你一言我一语地聊得火热,聊到一半被抢话也不卡壳,自然衔接得像个人。

这不是特效。9月20日澳门的'湾区升明月'2026大湾区电影音乐节晚会上,智元灵犀X2给林依轮和任嘉伦的《爱情鸟》当伴舞,多台轮番上场;远征A3则进了直播间,跟主持人和明星就地互动。真正让它在网上刷屏的,不是能跳能聊,而是背后那颗'全模态'的具身大脑。

把'看、听、说、动'捏成一股绳

以前的人形机器人对话,大多是'割裂'的:先靠语音识别把你说的转成文字,再用语言模型生成回答,最后单独让动作模块按剧本动一下。三步各干各的,反应慢、卡顿,稍不留神就冷场。

智元这次用的WITA-Omni,是个端到端全模态交互大模型。它把视觉、听觉、语言、表情、肢体动作全部放进一个统一决策空间里同时处理——一边看你在哪、什么表情,一边听你在说什么,然后在同一条时间轴上生成语音、动作和表情。说白了,机器不再'分步思考',而是像真人一样'边看边听边说边动'。

'社牛'是怎么来的:能读脸、能接话、能被打断

为什么直播间的机器人显得特别'会来事'?因为它有在场感。它能读懂对面人的情绪——你高兴、你犹豫、你想插话,它看得出来;你说到一半被打断,它能无缝接上,不冷场、不自说自话地硬接着背台词。

这种能力不是单靠堆参数堆出来的。在7月具身全模态理解的权威榜单DailyOmni上,WITA-Omni Preview就凭视频和音频联合理解、时序推理能力,以85.21分的综合成绩登顶过榜首。一个模型能同时扛住'看懂画面''听懂人话''推演上下文'三件事,这是过去人形机器人很少能拿出手的。

能跳舞的很多,能'对话'的才是分水岭

这两年人形机器人会跑会跳的不少,运控技术卷得厉害。但有一个残酷的事实:大部分机器人只有'身体',没有'灵魂'。你让它翻个跟头可以,可你想跟它正经聊一场天、让它观察你的状态来调整互动,它就露怯了。

从'动作复刻'到'运动加思考',是从'会表演'迈向'会相处'的分水岭。晚会上的灵犀X2能踩着节奏起舞是运动智能,直播间里的A3能读懂情绪、随机应变是交互智能加情感智能——这两种能力叠在一起,机器人才真正从'工具'往'伙伴'的方向挪了一步。

写在最后

会跳舞的机器人很多,会'接话'、能'读懂你脸色'的机器人,目前还是稀缺品。智元这波全模态交互,把'理解人'这件事往前推了一大截。

当然,舞台和直播间总是最光鲜的。这套大脑真正要经受的考验,是在超市理货、在酒店前台、在医院陪护这些更真实也更嘈杂的场景里,还能不能稳住。技术从'会来事'到'真办事',中间那段路,才最见功底。

版权声明:
作者:算法老K
链接:https://www.aiddithome.com/p/1a17e3b43f5bda.html
来源:人形机器人
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以点击 “举报”


登录 后发表评论
4条评论
Prompt工程师小林
1楼 · 7小时前

这个'边看边听边说边动'的端到端思路才是关键,比传统三四步串联的对话流程快了一个量级。我调prompt时就特别吃这种统一时间轴的体验。

工具猎人
2楼 · 7小时前

我试过不少所谓'会聊天'的机器人,基本都是背台词,一被打断就傻眼。智元这个能接住抢话、还读得懂情绪,算是我见过交互最自然的之一。

效率女王米米
3楼 · 7小时前

能读情绪这点太戳打工人了,要是真能有个随时接住我话、还不冷场的搭子,干啥活都轻松点。

硅谷子
4楼 · 7小时前

从'会跑会跳'到'会看脸色、接住话头',这场晚会让大众第一次直观摸到具身智能交互的天花板。硅基世界,万物皆码。