传统AI视频编辑工具往往音画分离,需手动处理音频且操作门槛高。InstructAV2AV框架通过自然语言指令实现音视频同步编辑,无需掩码标注即可自动对齐音画。本文将解析其技术架构、部署流程与微调方法,帮助开发者判断是否适合本地化音视频协同编辑需求。
核心功能与解耦控制能力
InstructAV2AV是一款面向已有视频的指令式音视频联合编辑开源模型框架。输入原始视频与自然语言编辑指令后,模型会同步修改画面与对应音频,自动保留背景环境音效,实现音画时序对齐。相比传统工具需手动框选区域或后期单独替换音频,该框架大幅降低操作门槛。
框架提供多维度解耦控制能力,人脸身份、人声音色、人物台词与画面物体可独立调节。开发者可组合使用以下编辑模式:
- 保留人脸改声音或保留音色改长相
- 人脸与声音全部保留,仅修改台词内容
- 通用画面修改、物体插入、物体移除、身份克隆与音色克隆

技术底座与权重配置
底层组件与数据集
项目基于Ovi音视频融合骨干网络构建。视频生成部分复用Wan2.2‑TI2V‑5B组件,音频编解码依赖MMAudio声码器与音频VAE,实现视频潜空间与音频潜空间的对齐融合。
配套开源InsAVE‑80K大规模配对音视频编辑数据集,托管于Hugging Face。每条样本包含原始视频、原始音频、编辑后音视频及编辑指令,支持JSONL与CSV格式,用于模型微调与效果评测。
预训练权重分组
项目提供6套面向不同任务的微调权重,存放于ckpts目录,开发者可根据实际需求选择:
| 权重名称 | 核心能力 | 适用任务 |
|---|---|---|
| general | 通用音视频编辑 | 修改场景、人物外观、动作、台词、音效 |
| insertion | 物体插入 | 向视频增加物体并生成配套对应音频 |
| removal | 物体移除 | 删除画面物体,同步抹除物体关联声音 |
| clone_id | 人脸身份保留 | 保持人物长相,修改音色、台词、画面内容 |
| clone_voice | 音色保留 | 维持原有音色,更换人物形象、改写台词 |
| clone_id_voice | 人脸+音色双保留 | 样貌声音不变,仅修改人物台词内容 |
本地环境部署与推理运行
环境准备与权重下载
运行环境需满足Python 3.10与CUDA 12.1,依赖PyTorch 2.6.0与FlashAttention。克隆仓库并安装依赖:
git clone https://github.com/suimuc/InstructAV2AV cd InstructAV2AV pip install -r requirements.txt python setup.py install
使用huggingface-cli下载预训练权重至本地ckpts文件夹,同时下载Wan2.2与MMAudio底层依赖权重。若网络不佳,可手动访问Hugging Face项目页面下载,确保文件夹命名与配置文件路径一致。
推理运行方式
- 命令行批量处理:执行
scripts/edit.py,传入源视频路径与编辑指令,选择对应任务权重,输出编辑后的音视频文件。 - Gradio网页交互:运行
python scripts/demo.py启动本地网页,上传视频并填写指令即可可视化完成编辑。
编辑台词时需使用标记格式以实现精准替换,同时支持导入外部音频替换原视频音轨。文本
模型微调与训练配置
框架提供全链路开源交付,包含推理代码、Gradio Demo、训练脚本与数据集。训练采用Accelerate与DeepSpeed ZeRO‑2多卡方案,配置文件位于ovi/configs/train/train_av_edit.yaml。
修改yaml文件配置数据集路径、权重路径与输出目录后,使用DeepSpeed多卡启动scripts/train.py执行微调。训练支持三种模式:音视频联合训练、仅视频训练、仅音频训练,开发者可基于InsAVE‑80K数据集二次微调以适配垂直业务场景。
常见问题与硬件建议
硬件配置与运行限制
官方未明确最小显存阈值,但作为大模型音视频联合方案,建议使用24GB及以上显存的NVIDIA显卡。显存不足易触发OOM,可开启梯度检查点降低占用。模型体量较大,CPU推理速度极慢,不具备实用价值,必须使用NVIDIA CUDA显卡。
音画同步与效果优化
若编辑后音画不同步,优先检查是否选用匹配任务的权重,台词编辑务必使用标记。源视频画面抖动剧烈或人物动作复杂时,模型对齐效果可能下降,补充更详细的文本指令可提升生成质量。内容
版权与商用说明
项目代码遵循Apache‑2.0协议,数据集使用约束需参考Hugging Face数据集主页说明。商用前请自行确认InsAVE‑80K数据集的版权合规性。
单模态编辑支持
若仅需修改音频而不改动画面,可在指令中明确要求保持画面不变,并搭配clone_id_voice权重,模型将优先更新音频台词部分。
