阿里云近日又带来一项重磅更新——由通义实验室研发的视频生成模型EMO,现已正式登陆通义App,并面向所有用户免费开放。简单来说,你只需在App内挑选一个模板(例如热门歌曲、网络热梗或表情包),再上传一张个人照片,EMO就能自动为你合成一段“边唱边演”的短视频。

阿里云在视频生成领域的创新
首先来聊聊EMO到底是什么。它的全称是Emote Portrait Alive,由阿里巴巴智能计算研究院打造,本质上是一套基于音频驱动的AI肖像视频生成系统。具体实现原理是:你只需提供一张参考图像(人物肖像),再给出一段音频(可以是语音、歌曲,甚至是你喜欢的BGM),EMO就能自动输出一段表情丰富、头部动作自然的视频,且这些动作与表情会与音频内容精确同步。
值得关注的是,通义App首批已上线80多个EMO模板,包括《上春山》《野狼Disco》等热门歌曲,以及网络流行表情包梗“钵钵鸡”“回手掏”等。自今年2月底公布论文以来,该模型在国内外引发了广泛关注,甚至有用户将其与OpenAI的Sora相提并论。
音频驱动,一张照片即可成为主角
从功能体验来看,EMO的操作非常直观。你只需选择模板、上传照片,模型便会自动开始处理。它依托先进的音视频扩散模型与注意力机制,生成的肖像视频真实感出色,表情与动作自然流畅,几乎与音频内容无缝同步。
在应用场景方面,EMO拥有广阔的想象空间。它不仅是娱乐工具——还能让历史人物“复活”、为电影角色配音、制作教育课件中的虚拟讲师,甚至应用于广告宣传和游戏角色,都是顺理成章的事情。
此外,阿里在效率方面也做了优化。EMO采用了高效的算法与计算框架,能够在相对较短的时间内生成高质量视频,对追求效率的用户来说十分省心。而且该框架具备良好的可扩展性与灵活性,后续可根据需求进行定制优化,比如调整参数或增加新的模型组件,进一步提升视频质量。
技术创新不止于生成
事实上,阿里在视频生成领域一直深耕不辍。除了EMO,此前还推出过VideoComposer——这是一个融合空间条件与时序条件的视频生成框架。它能够以单张图像或草图作为空间条件,同时结合运动矢量、深度序列等时序条件,生成视觉上极为逼真的视频内容。
此外,AtomoVideo模型也值得注意,它能够从一张静态图片生成高质量的视频序列,并支持结合文字描述来生成符合特定需求的视频内容。
阿里云视觉智能开放平台同样提供了丰富的视频生产能力,例如视频摘要、智能编辑、人脸融合等。这些工具已在电商、影视、广告等多个领域落地,帮助用户快速产出高品质视频。
视频生成使用到的AI
技术和算法
谈到视频生成,目前市面上已有不少工具,如Pixverse、Pika、Runway Gen-2、Kaiber、Plaiday、Genmo等。其中Pika凭借稳定且高质量的画质赢得了大量用户,Runway Gen-2则能将Midjourney生成的图片转化为动画。Sora作为新秀,能够生成高质量的长视频,并理解长文本指令,输出细节丰富的视频内容。
从算法底层来看,视频生成离不开一些基础技术。例如循环神经网络中的GRU与LSTM,能够有效处理梯度消失与衰减问题;编码器-解码器(encoder-decoder)架构则大幅提升了机器翻译等任务的效果。这些技术同样在视频生成中扮演关键角色,用于处理内容的生成、结构及风格控制。
更具体地看,视频生成所涉及的核心技术主要包括以下几个方面:
深度学习模型
这是最核心的环节。生成对抗网络(GANs)和变分自编码器(VAEs)等深度学习模型,能够学习并模仿视频数据的分布,从而生成与原始数据高度相似的全新视频内容。
计算机图形学
在创建虚拟场景、角色和特效时,计算机图形学尤为重要。它可以生成逼真的虚拟场景与角色,并与真实视频相结合,创造出独特的视觉效果。
物理模拟
为了让生成的视频更具真实感,物理模拟技术负责模拟物体的运动与交互,例如运动轨迹、碰撞效果、光影变化等。只有细节做到位,视频才显得可信。
自然语言处理
如今自然语言处理(NLP)也已融入视频生成领域。通过解析文本描述,NLP技术能够指导模型生成与文字内容相匹配的视频,为创意表达开辟了更广阔的空间。
音频合成技术
视频不仅包含画面,音频同样至关重要。音频合成技术可以生成与视频内容匹配的音效和背景音乐,显著提升整体观看体验。此外,增强学习、迁移学习等技术也在其中发挥作用,使视频生成更加灵活、高效且多样化。
写在最后
经过近几年的发展,视频生成技术已逐步成熟,在新闻报道、广告制作、教育培训、电影游戏乃至医疗健康等领域都得到了实际应用。未来,娱乐媒体、广告营销、教育培训、虚拟现实/增强现实、医疗健康等,都将是视频生成技术的主流落地场景。从EMO这一波操作来看,AI视频生成,确实离我们更近了一步。
