通义万相最新开源的模型,值得所有关注AI视频生成领域的人认真了解。这次发布的是Wan2.2-S2V,一个基于音频驱动视频的模型——用户只需提供一张图片和一段音频,就能生成电影级别的数字人视频。无需复杂设备,也无需专业后期制作,这相当于将内容创作的门槛再次大幅降低。
具体来看,本次开源有以下几个关键亮点:
音频驱动视频生成:远不止单纯对口型
Wan2.2-S2V能够驱动真人、卡通形象、动物、数字人等多种类型的图片,且支持任意画幅——无论是肖像、半身还是全身画面,都能轻松驾驭。用户上传一段音频后,模型能让画面中的人物仿佛真正活过来:说话、唱歌、表演,口型与音频实现精准同步。
通义团队的做法是将通用视频生成能力与两种控制手段有机结合:一方面利用文本引导整体画面的运动方向,另一方面借助音频驱动人脸、嘴部等细微局部动作。为了实现更精确的控制,模型引入了AdaIN和CrossAttention两种机制,确保音频信号能够真正“翻译”成画面中自然的表情与口型变化。可以说,这不仅仅是“让嘴巴动起来”,而是让整个人物的神态与声音融为一体。
分钟级长视频生成:稳定输出是关键突破
在生成时长方面,Wan2.2-S2V单次生成的视频时长已达到业界领先的分钟级。这意味着什么?此前许多模型生成几秒内容后就开始出现偏差,人物表情变得诡异,背景“崩坏”——这正是“长视频一致性”这一长期难题的表现。
Wan2.2-S2V的解决方案是通过层次化帧压缩技术,大幅降低历史帧的Token数量。这样一来,模型可以将motion frames(即历史参考帧)的长度从几帧扩展到73帧。更多的参考帧意味着模型在生成后续内容时能保持更强的“记忆力”,画面稳定输出因此不再是难题。
文本控制:画面细节可“调”出来
此外,Wan2.2-S2V还支持文本控制。用户输入一段Prompt(提示词),即可对视频画面进行调整——镜头如何运动?人物的运动轨迹是什么?画面中的主体之间如何互动?这些都可以通过文字直接操控。
从实际效果来看,视频中主体的运动和背景的变化会更加丰富,不再是一条单调的“大头念稿”。
全参数化训练:多分辨率场景的底气
在训练层面,通义团队也投入了大量资源。他们构建了一个包含超过60万个片段的音视频数据集,通过混合并行训练进行全参数化训练,充分挖掘了Wan2.2-S2V模型的性能。更重要的是,模型通过多分辨率训练,支持不同分辨率场景下的推理——无论是竖屏短视频还是横屏影视剧,都能完美适配。
举一个具体的例子,看看它实际能做到什么程度:
比如这个「弹钢琴DEMO」,用户只需上传一张人物弹钢琴的照片、一段歌曲以及一段描述文字,Wan2.2-S2V就能生成一段完整的钢琴演奏视频。最终效果如何?人物形象与原图保持一致,面部表情和嘴部动作与音频同步对齐,画面中人物的手指形态、力度、速度甚至能与音频的节奏完美配合。
