8月31日,千问创作正式推出了一个叫Agent Teams的新功能。简单说就是:你把一个视频创作任务拆成多个环节,每个环节交给不同的AI Agent来分工完成。脚本Agent写文案,画面Agent生成图像,剪辑Agent负责拼接,配音Agent处理音效。整个过程不再是“一个AI从头干到尾”,而是“一群AI各司其职”。
这个功能接入了Wan 3.0视频生成模型及其Prime版,同时整合了Qwen-Image-3.0等图像模型。目前已面向全部用户开放。
为什么多Agent比单Agent更适合创作
视频创作本质上是一个多步骤、多模态的工作流。从脚本构思到分镜设计,从画面生成到配音配乐,每个环节需要的能力完全不同。让一个模型包揽所有环节,就像让一个人同时当编剧、导演、摄影师、剪辑师和音效师,效果可想而知。
多Agent协同的逻辑不一样。每个Agent只专注自己最擅长的事:脚本Agent专攻叙事逻辑和节奏感,画面Agent专注视觉生成质量,剪辑Agent处理转场和时间轴。每个环节的产出质量都有保障,最终组合起来的效果自然更好。
这也是为什么千问创作选择用Agent Teams而不是单个模型升级来做这件事。不是“一个更强的模型”,而是“一组专精的Agent”。
Wan 3.0带来了什么
这次Agent Teams的底层视频生成能力来自Wan 3.0。阿里通义在8月24日正式上线了这个模型,相比上一代在画面质量、运动连贯性和风格控制上都有明显提升。Prime版本进一步提高了生成分辨率和细节精度。
从实际效果来看,Wan 3.0在人物一致性和场景连贯性上做得比前代好很多。之前的AI视频最让人出戏的就是角色换着换着就变脸了,场景跳着跳着就穿帮了。Wan 3.0在这些方面有显著改善,虽然还不能说完美,但至少在短视频场景下已经够用了。
对创作者意味着什么
对于个人创作者来说,Agent Teams最大的价值不是“做得更快”,而是“做得出来”。以前一个人想做一条带分镜、有配音、有特效的视频,要么学一堆软件,要么花钱请团队。现在这些环节都有Agent帮你干了。
但也要注意,多Agent协同不是“一键出片”。你仍然需要理解每个Agent的能力边界,知道怎么拆解任务、怎么给每个Agent下达清晰的指令。本质上,你的角色从“执行者”变成了“导演”,需要把控整体节奏和最终质量。
这对创作者的能力结构提出了新要求:技术门槛降低了,但审美和策划能力变得更重要了。会用工具的人很多,能讲好故事的人永远稀缺。
行业趋势:从单Agent到多Agent
千问创作不是第一个做多Agent协同的。最近几个月,多Agent架构几乎成了AI产品的新标配。谷歌Search的AI信息Agent、腾讯WorkBuddy的技能编排、Salesforce和USC联合开发的CoAct-1,都在用类似的思路。
背后的逻辑很简单:单个模型的能力天花板是可以预见的,但多个专精Agent的组合能力几乎是无限的。每个Agent专注一个细分领域,通过编排层协同工作,最终呈现出的能力远超单个模型。
这也是为什么Gartner在最新报告中说“代理型AI才是企业新宠”。不是生成式AI不行了,而是单Agent已经不够用了。多Agent协同才是下一个阶段的主旋律。
写在最后
Agent Teams的上线,标志着AI视频创作从“一个AI帮你干活”进化到了“一群AI组团队帮你干活”。对个人创作者来说,这是一个真正的生产力跃迁。但跃迁之后,竞争的重心也变了:不再是“会不会用AI”,而是“能不能当好AI团队的导演”。
导演这个比喻很贴切。以后创作者的核心竞争力不是技术,是想法。会讲故事的永远稀缺。
技术门槛降了,审美门槛升了。这句话太对了。现在谁都能用AI出图出视频,但做出来的东西有没有灵魂,全靠创作者自己的审美和故事能力。
从单Agent到多Agent,这个趋势我在其他领域也看到了。谷歌搜索的AI信息Agent、WorkBuddy的技能编排,都是类似的思路。单模型能力天花板在那里,多Agent组合才是未来。
Wan 3.0我试了一下,人物一致性确实比上一代好很多。之前做个30秒短片,主角换了三四张脸,现在至少能维持住。但运动连贯性还是有改进空间,快速转场的时候偶尔会出现帧间抖动。
多Agent协同做视频这个方向确实对。一个人做视频最痛苦的就是每个环节都要切换思维模式。刚写完脚本的情绪还在,就要去调色彩平衡,脑子根本跟不上。现在交给不同Agent各自处理,创作者只需要把控整体节奏,这个分工逻辑是对的。