阿里 Wan 3.0 开启公测:单段 30 秒、支持文档输入,画面更接近电影镜头
2026/08/06 22:34阅读量 2
阿里视频生成模型 Wan 3.0 开启公测,支持一次生成 30 秒单段视频,并首次接受 PPT、Word、Excel 等文档格式输入。实测显示其画面质感、角色一致性和镜头调度能力明显提升,能完成一镜到底 MV、动漫短片等较完整叙事;视频编辑也可定位到问题片段进行局部修改。API 将于近期全量开放,720P 定价 0.6 元/秒。
事件概述
阿里视频生成模型 Wan 3.0 开启公测。相比前代,两个主要升级为:可一次生成最长 30 秒的单段视频;除文本、图片、音频、视频外,还支持 doc、xls、ppt、pdf、md 等多种文档格式直接作为输入。
核心信息
- 单次 30 秒,叙事空间变大:Wan 3.0 支持生成 30 秒视频,并配有智能时长功能,可根据提示词推荐时长,不足时继续续写。目前在同类模型中,仅有两家支持单次生成 30 秒视频。
- 多格式输入:首次支持 PPT、Word、Excel、PDF 等文档格式,创作者可结合产品图与介绍文档,直接生成广告形象片等完整内容。
- 一致性增强:参考生视频模式下,角色、道具、声音、空间关系、风格等细粒度维度能稳定保持;以参考图作为首帧生成时,人物面部特征和服装款式不会发生漂移。
- 编辑能力升级:支持修改画面、剧情与台词,可定位到具体时间区间,只替换有问题的片段,避免反复整段重抽。
实测表现
实测中,Wan 3.0 的画面美感明显提升,五官和皮肤细节更精细,光影和运镜更接近有意图的摄影语言。它可完成约 20 秒的电影级 One-Take MV,在多人唱跳场景中保持人脸与肢体交叠的一致性;也可生成日式动漫风格短片,还原赛璐璐线条与高对比度色彩,并完成连续运镜和复杂机位变化。此外,对东方仙山、水墨奇幻等风格的刻画也具有较强氛围感。
不足之处主要在于声音质感与画面偶有贴合度问题,环境音的空间感有待改善。
值得关注
AI 视频的讨论正从“能不能做到”转向“如何更好地完成具体创作目标”。Wan 3.0 的 API 将于近期全量开放,价格按分辨率计费:480P 0.3 元/秒、720P 0.6 元/秒、1080P 1.2 元/秒。以常用的 720P 计算,约为主流模型的六折。
