文字或图片输入
可从文字场景开始,也可让一张关键视觉动起来。
Cinel 上的通义万相 Wan 2.6 可用一句提示词或一张图片生成 2–15 秒、带原生音频的多镜头视频,支持 720p/1080p 和五种画幅,145 积分起。
看看一张参考图如何变成动态镜头。
可从文字场景开始,也可让一张关键视觉动起来。
生成有规划的连续镜头,而不是孤立的单个片段。
生成视频时同步获得音频。
深入了解底层生成逻辑、设计考量、关键参数与最佳实践流程。
Wan 2.6 是阿里巴巴通义万相视频家族中的“电影档”——当一段视频应该像一个段落而不是一个瞬间时,就选它。写一段简短的脚本,它能规划多个镜头、在镜头之间调度机位,并把整段内容连同同步的声音一起交付。视频时长可在 2 到 15 秒之间设置,分辨率 720p 或 1080p。Cinel 上 145 积分起,默认 16:9、5 秒、720p。
它最核心的能力是多镜头叙事。大多数文生视频工具只给出一个连续镜头和泛泛的运动。Wan 2.6 可以在“单一连续镜头”和“多镜头”模式之间切换,后者会在不同机位间切换。比如一段 12 秒的需求:“黄昏天台的全景建立镜头,切到她看手机的特写,再切到城市灯火”,返回的是一段有规划、镜头间保持连贯的小剪辑。
声音也被设计进这个结构里:对白、环境声和配乐随视频一起生成,模型还支持叙事类内容的自动旁白。再加上比入门款 Wan 2.5 更顺滑的物理与光影、2–15 秒的灵活时长和五种画幅——包括适合信息流和演示文稿的 4:3、3:4——它瞄准的是品牌故事和广告主视频,而不是日更量产。
| 项目 | Wan 2.6 |
|---|---|
| 开发方 | 阿里巴巴通义万相团队 |
| 模式 | 文生视频、图生视频(首帧) |
| 镜头类型 | 单一连续镜头 · 多镜头 |
| 时长 | 2–15 秒(Cinel 默认 5 秒) |
| 分辨率 | 720p / 1080p(1080p 每秒约 1.67 倍) |
| 画幅 | 16:9、9:16、1:1、4:3、3:4 |
| 音频 | 原生音频,支持自动旁白 |
| Cinel 参考图 | 1 张 |
| Cinel 消耗 | 145 积分起 |
Wan 2.5(75 积分起)更便宜,还有 480p 测试档,但只生成 5 秒或 10 秒的单镜头——适合日更量产。Wan 2.7(160 积分起)增加首尾帧控制以及图片、音频、视频参考——需要控制镜头落点或匹配声音时选它。当首要目标是带原生声音的多镜头故事时,选 Wan 2.6。
它不是一个连续镜头,而是在同一段视频里生成多个不同机位的镜头,并让人物和场景在切换中保持一致。
2 到 15 秒之间任意设置。时长越长,多镜头段落中每个镜头的空间越充裕。
有。音频与视频一同生成,模型还支持叙事内容的自动旁白。
五种:16:9、9:16、1:1、4:3 和 3:4。
不能。Wan 2.6 支持首帧图片;需要首尾帧控制请使用 Wan 2.7。
145 积分起。选择 1080p 或更长时长会提高生成前显示的预估。