游乐游手机版
首页/AI热点日报/热点详情

小米开源ControlFoley,实现可控视频音效精准定制

类型:热点整理2026-07-24
小米研究团队开源了可控视频音效生成模型ControlFoley,标志着视频配音技术从自动化走向可定制化。该模型通过统一的框架,首次同时支持文本引导、文本控制和参考音频控制三类任务,让创能根据意图精准定制视频声音。其核心技术包括自训练的时空音视频编码器CAV-MAE-ST和时间-音色解耦策略,有效

视频音效生成技术正迎来关键突破。小米大模型应用团队近日开源了名为ControlFoley的统一可控视频音效生成模型,旨在解决视频配音中的“可控性”难题。该模型不仅支持根据画面自动生成音效,更首次统一实现了文本引导、文本控制及参考音频控制三类核心任务,让创作者能够真正按意图为视频定制声音,从而大幅提升视频音效生成的灵活性与精准度。

小米开源可控视频音效生成模型ControlFoley,实现声音精准定制

传统的视频音效生成模型主要依赖画面内容,虽然能让无声视频“有声音”,但创作者难以干预生成结果。ControlFoley的核心目标是将视频音效生成从“看画面配声音”推进到“按意图配声音”的新阶段。该模型在多个公开评测基准上取得了开源模型中的最佳表现,并在语义对齐、时间同步及声音质量等关键指标上实现全面提升,为AI音效生成领域树立了新的标杆。

统一框架支持三类可控生成任务

ControlFoley构建了一个统一的多模态音频生成框架,具备三类核心能力。首先是文本引导视频配音,模型根据视频和文本提示生成同步音效,文本用于补充和细化画面中的声音语义。其次是文本控制视频配音,当文本描述与视频画面语义发生冲突时,模型能优先遵循文本意图生成目标声音,同时保持与视频动作的时间同步。最后是参考音频控制视频配音,模型根据视频和一段参考音频生成音效,使输出声音在音色和风格上贴近参考,同时不破坏视频本身的节奏。这三类可控视频配音任务让创作者在声音定制上拥有前所未有的自由度。

核心技术:联合编码与时间-音色解耦

为实现精准控制,团队提出了多项创新技术。针对视觉信息在多模态融合中过于强势的问题,团队自训练了时空音视频编码器CA V-MAE-ST。该编码器通过视频帧与音频特征的联合建模,专门捕捉“动作何时发生、声音应何时出现”这类音视频时空对应关系,增强了模型对动作节奏和时间同步的理解,从而提升视频音效生成的时间对齐精度。

在参考音频控制方面,模型采用了时间-音色解耦策略。该策略能有效抑制参考音频中冗余的时间节奏信息,保留关键的全局音色特征,从而让参考音频主要控制“声音听起来像什么”,而视频则控制“声音什么时候发生”,避免了参考音频的节奏干扰视频本身的同步。这一创新使得AI音效生成模型在保持音色一致性的同时,精准匹配视频节奏。

多模态鲁棒训练与性能表现

为适应真实应用中用户输入条件不固定的情况,ControlFoley采用了随机模态丢弃和统一多模态表示对齐训练,确保模型在不同条件组合下都能稳定工作。评测结果显示,在VGGSound-Test、Kling-Audio-Eval等多个基准测试中,ControlFoley均取得了开源SOTA表现,验证了该开源模型在视频音效生成领域的领先性。

与部分方法相比,ControlFoley在乐器演奏、体育运动等场景中生成的声音,能在动作发生的关键时刻精准对齐视频节奏,并保留更完整的高频细节。对比商业闭源系统Kling-Foley,ControlFoley在语义对齐、时间同步和声音质量等关键体验指标上也展现出竞争力。目前,该模型的代码、模型权重、技术报告及在线演示均已向社区开放,为视频音效生成技术的研究与应用提供了强大助力。

来源:IT之家

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。