游乐游手机版
首页/AI热点日报/热点详情

蚂蚁集团开源EchoMimic实现AI照片对口型

类型:热点整理2026-07-20
蚂蚁集团开源EchoMimic,融合音频特征与面部关键点,使静态人像照片随声音自然对口型,同步呈现面部表情与细微动态,支持多语言及唱歌,可应用于数字人、视频配音等场景。

近期,蚂蚁集团开源了一款名为EchoMimic的AI项目,其核心功能是让静态人像照片根据音频内容实现精准对口型,效果非常自然。该技术融合面部特征与语音信号,生成的视频不仅嘴型同步,连面部表情也会随之动态变化,彻底告别了早期技术常见的僵硬感。

AI 根据声音内容帮照片“对口型”,蚂蚁集团开源 EchoMimic 项目

EchoMimic的技术核心在于将音频特征与面部标志点(如眼睛、鼻子、嘴巴等关键结构信息)进行深度融合。模型通过学习声音与嘴部动作之间的映射关系,使得生成结果更接近真实人类的说话状态。不仅如此,它还能呈现额头、脸颊等区域的细微表情变化,而不仅仅是简单的嘴部运动。

在功能方面,EchoMimic提供了多种应用模式:仅凭音频即可生成肖像视频,或仅通过面部标志点驱动,而最实用的则是将音频与照片结合,实现逼真的对口型效果。此外,它支持中文普通话、英语等多种语言,甚至能应对唱歌场景,应用范围非常广泛。

附相关链接:

  • 官方项目主页:https://badtobest.github.io/echomimic.html

  • GitHub开源仓库:https://github.com/BadToBest/EchoMimic

来源:https://www.1ai.net/15369.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。