Wan2.2-S2V 以角色图像和音频驱动说话、演唱与表演视频,把角色动画的控制入口从文字提示转向“谁在表演、说什么、用什么声音”。这对短漫剧对白镜头有直接吸引力,但一张角色图和一段音频能否支撑长段落、不同景别和跨镜头身份,需要项目测试回答。
官方仓库确认以图像和音频驱动角色
Wan2.2 官方仓库将 S2V 描述为以角色图像和音频驱动说话、演唱与表演视频,并提供相应模型路线。
官方范围能建立测试候选,不证明具体角色、语言、音频长度和景别上的稳定性。
对白镜头是四个系统的交叉点
角色身份要保持,声音权利和音色要正确,口型与节奏要匹配,表演还要符合剧情。模型可能在其中三项表现良好,却因视线、手势或情绪失败而不可交付。
长音频也会放大漂移:角色细节、头部运动和口型误差会随时间积累,剪辑点和重生成边界需要提前设计。
按角色、语言与时长分层测试
测试集应包含正面、侧面、遮挡、不同景别、快慢语速、情绪变化、歌唱和停顿,并由同一组人员分别评价身份、口型、表演和声音。
每个镜头保存角色参考、音频来源与授权、模型版本、失败原因和人工修复,才能决定哪些对白类型进入 S2V 路由。
尚无法确认:官方样片和仓库说明不能支持与其他模型的质量排名,也不能推断特定硬件成本。测试必须锁定模型路线、版本、输入和验收人。
