文字或图片输入
可从文字场景开始,也可使用一张或两张关键帧。
Cinel 上的通义万相 Wan 2.7 可用文字、首尾帧或图片、音频、视频参考生成 2–15 秒视频,支持 720p/1080p 与声音匹配,160 积分起。
看看一张参考图如何变成动态镜头。
可从文字场景开始,也可使用一张或两张关键帧。
需要更多视觉约束时可使用最多三张图片参考。
选择 720p 或 1080p,并设置 2 到 15 秒的时长。
深入了解底层生成逻辑、设计考量、关键参数与最佳实践流程。
Wan 2.7 是 Cinel 上阿里巴巴通义万相系列中可控性最强的模型。它可以从一句提示词开始,在你指定的两张关键帧之间生成动画,也可以综合参考图、一段声音和一段短视频来引导生成。时长 2 到 15 秒,分辨率 720p 或 1080p。如果说 Wan 2.5 是日常短片、Wan 2.6 是讲故事的能手,那 Wan 2.7 就是导演的工具——当镜头必须以特定方式开始、呈现和发声时用它。Cinel 上 160 积分起。
有三项能力让它区别于兄弟型号。第一是关键帧控制:提供首帧、尾帧或两者,模型会计算两者之间的运动轨迹,并保持主体稳定。Wan 2.6 只支持首帧。
第二是多模态参考。除了图片,Wan 2.7 还能接收一段音频和一段参考视频。在 Cinel 上最多可添加 3 张参考图来保持角色和视觉细节一致,模型还能让角色说话的声音贴合 1–10 秒样本中的音色——非常适合固定的主持人或品牌代言角色。
第三是更精细的提示词控制:反向提示词告诉模型要避开什么(多余的手指、字幕叠加、杂乱背景),可选的提示词增强则能把简短的想法扩写成完整需求。在模型层面,Wan 2.7 还支持对已有的 2–10 秒视频进行指令式编辑,比如把背景换成雨夜街道,而不必全部重新生成。
| 项目 | Wan 2.7 |
|---|---|
| 开发方 | 阿里巴巴通义万相团队 |
| 模式 | 文生视频、首尾帧图生视频、参考生视频;模型层面支持视频编辑 |
| 时长 | 2–15 秒(Cinel 默认 5 秒) |
| 分辨率 | 720p / 1080p,30 帧/秒(1080p 每秒约 1.67 倍) |
| 画幅 | 16:9、9:16、1:1、4:3、3:4 |
| Cinel 参考 | 最多 3 张图片 · 15 秒音频 · 15 秒视频(音视频限会员) |
| 声音样本 | 1–10 秒,用于声音匹配 |
| 提示词工具 | 提示词最长 5000 字符;反向提示词最长 500 字符;可选提示词增强 |
| Cinel 消耗 | 160 积分起 |
与 Wan 2.6(145 积分起)相比,Wan 2.7 增加了尾帧控制、音频与视频参考、声音匹配和反向提示词;如果自动多镜头叙事更重要,就选 Wan 2.6。与 Kling O1(230 积分起,仅 5/10 秒)相比,Wan 2.7 以更低的起价提供首尾帧动画,时长可在 2–15 秒任意设置,还能用你自己的音轨驱动视频。
Wan 2.7 增加了尾帧控制、音频与视频参考、根据短样本匹配声音、反向提示词以及模型层面的视频编辑。Wan 2.6 只支持首帧。
上传一张图作为开场帧、一张作为结尾帧,或两者都上传。模型会推断中间的运动并保持主体一致。
在参考模式下,模型可以让角色语音贴合 1–10 秒音频样本的音色特征。请只使用你有权使用的声音。
反向提示词列出你不想要的内容,比如字幕、水印或多余的人物,有助于让营销素材保持干净。
最多 3 张参考图,会员还可以添加一段最长 15 秒的音频或视频参考。
在 Cinel 上 160 积分起。时长、分辨率和参考素材都会影响生成前显示的预估。