8月24日,阿里正式上线了视频生成模型万相3.0(Wan3.0)。这次最值得注意的不是什么技术参数,而是一个产品能力上的跨越:你可以直接丢一个文档(PPT、PDF、Word、网页链接)进去,它给你生成一段30秒的视频。
上一次,万相2.7版本最长只能生成15秒视频,而且文生视频、图生视频、视频编辑是分开四个接口调用的。这次3.0直接统一成一个接口,时长翻倍,还新增了文档和网页输入。
为什么“文档转视频”这件事不一样
之前市面上大部分视频生成模型,核心能力是“文字描述→视频画面”或者“图片→视频”。本质上,它们解决的是“把一句话变成动态画面”的问题。
万相3.0新加的“文档转视频”,解决的完全是另一个问题:把一份结构化的信息(比如一份产品方案、一个教学课件、一个季度报告)变成一段可视化的视频。
这两个需求的难度和商业价值差了一个量级。
前者是创意工具——你描述一个场景,它给你画面。后者是生产力工具——你把一份PPT扔进去,它直接帮你做出一段能发的产品宣传片。对内容创作者、运营人员、教育工作者来说,后者的实用价值高出太多。
价格怎么样
中国区按输出时长计费:480P每秒0.3元,720P每秒0.6元,1080P每秒1.2元。一条30秒的1080P视频大概36块钱。输入和失败调用不收费。
对比一下海外竞品:Runway Gen-4大约是每条视频0.05-0.50美元(根据分辨率和时长),Synthesia更贵(企业定制级别)。万相3.0在国内市场的定价,算是有竞争力的。
但有一个关键信息:万相系列从2.5版本开始就不再开源了,也没有开放模型权重。阿里这次选择了完全闭源商业化的路线。
对内容创作者意味着什么
如果你是一个做自媒体或者运营的人,这个能力很直接地意味着:以前做一段产品介绍视频,你需要写脚本、找素材、剪辑配音,半天到一天。现在,把现成的产品文档丢进去,几分钟出一段30秒的视频。
当然,30秒还是偏短,很多场景需要更长。但“文档输入+视频输出”这个链路一旦跑通,后续的升级方向就很清晰了:更长时长、更多风格、更好的字幕和配音。
另外一个有意思的信号:这次万相3.0选择和阿里800亿港元配售募资的时间点几乎同步。阿里在AI上的投入力度明显在加大,万相作为视频生成赛道的核心产品,商业化节奏会加快。
视频生成赛道的下一步
2026年,视频生成已经从“能出图”进化到“能干活”。万相3.0的“文档转视频”、MiniMax在Sol-Engine上实现的22-27倍生成加速、还有Perplexity下调信用额度20%降低使用门槛,这些都在指向同一个方向:视频生成正在从“技术Demo”变成“日常工具”。
对普通用户来说,真正的竞争不是谁的模型参数更高,而是谁的产品链路更短、价格更低、输出质量更稳定。万相3.0这次在产品能力上走了一步,能不能转化为市场份额,还得看后续体验。
终于有人把文档转视频做成产品了!每次给老板做汇报视频都要折腾半天剪映,如果能直接丢PPT出视频,我第一个充值 ?
30秒1080P视频36块,一天做10条也就360块。如果能把一个产品方案变成10条不同角度的短视频素材去投放,这个ROI算下来比请外包便宜太多了。
文档是“知”,视频是“行”。AI从“知”直接跳到“行”,中间的“知行合一”被算法填平了。有意思。
作为一个视频内容创作者,说实话有点复杂。一方面工具越来越强是好事,另一方面视频生成的门槛越来越低,意味着纯靠“能做视频”这件事本身已经不构成竞争力了。审美和叙事才是护城河。
文档转视频这个功能我比较好奇实际效果。PPT转出来的视频质量到底怎么样?是那种简单的动画翻页,还是真的能理解文档内容、自动配图配旁白?等实测。