游乐游手机版
首页/AI热点日报/热点详情

InstructAV2AV开源框架:文本指令驱动音视频同步编辑指南

类型:热点整理2026-08-31
InstructAV2AV是由智源研究院与北京大学联合开源的端到端音视频联合编辑框架,支持通过自然语言指令同步修改视频画面与音频。本文梳理其核心功能、技术架构、本地部署步骤及微调方法,帮助开发者快速上手并评估其在短视频创作、影视粗剪等场景中的适用性。

传统AI视频编辑工具往往音画分离,需手动处理音频且操作门槛高。InstructAV2AV框架通过自然语言指令实现音视频同步编辑,无需掩码标注即可自动对齐音画。本文将解析其技术架构、部署流程与微调方法,帮助开发者判断是否适合本地化音视频协同编辑需求。

核心功能与解耦控制能力

InstructAV2AV是一款面向已有视频的指令式音视频联合编辑开源模型框架。输入原始视频与自然语言编辑指令后,模型会同步修改画面与对应音频,自动保留背景环境音效,实现音画时序对齐。相比传统工具需手动框选区域或后期单独替换音频,该框架大幅降低操作门槛。

框架提供多维度解耦控制能力,人脸身份、人声音色、人物台词与画面物体可独立调节。开发者可组合使用以下编辑模式:

  • 保留人脸改声音或保留音色改长相
  • 人脸与声音全部保留,仅修改台词内容
  • 通用画面修改、物体插入、物体移除、身份克隆与音色克隆

InstructAV2AV(图1)

技术底座与权重配置

底层组件与数据集

项目基于Ovi音视频融合骨干网络构建。视频生成部分复用Wan2.2‑TI2V‑5B组件,音频编解码依赖MMAudio声码器与音频VAE,实现视频潜空间与音频潜空间的对齐融合。

配套开源InsAVE‑80K大规模配对音视频编辑数据集,托管于Hugging Face。每条样本包含原始视频、原始音频、编辑后音视频及编辑指令,支持JSONL与CSV格式,用于模型微调与效果评测。

预训练权重分组

项目提供6套面向不同任务的微调权重,存放于ckpts目录,开发者可根据实际需求选择:

权重名称核心能力适用任务
general通用音视频编辑修改场景、人物外观、动作、台词、音效
insertion物体插入向视频增加物体并生成配套对应音频
removal物体移除删除画面物体,同步抹除物体关联声音
clone_id人脸身份保留保持人物长相,修改音色、台词、画面内容
clone_voice音色保留维持原有音色,更换人物形象、改写台词
clone_id_voice人脸+音色双保留样貌声音不变,仅修改人物台词内容

本地环境部署与推理运行

环境准备与权重下载

运行环境需满足Python 3.10与CUDA 12.1,依赖PyTorch 2.6.0与FlashAttention。克隆仓库并安装依赖:

git clone https://github.com/suimuc/InstructAV2AV
cd InstructAV2AV
pip install -r requirements.txt
python setup.py install

使用huggingface-cli下载预训练权重至本地ckpts文件夹,同时下载Wan2.2与MMAudio底层依赖权重。若网络不佳,可手动访问Hugging Face项目页面下载,确保文件夹命名与配置文件路径一致。

推理运行方式

  • 命令行批量处理:执行scripts/edit.py,传入源视频路径与编辑指令,选择对应任务权重,输出编辑后的音视频文件。
  • Gradio网页交互:运行python scripts/demo.py启动本地网页,上传视频并填写指令即可可视化完成编辑。

编辑台词时需使用文本标记格式以实现精准替换,同时支持导入外部音频替换原视频音轨。

模型微调与训练配置

框架提供全链路开源交付,包含推理代码、Gradio Demo、训练脚本与数据集。训练采用Accelerate与DeepSpeed ZeRO‑2多卡方案,配置文件位于ovi/configs/train/train_av_edit.yaml

修改yaml文件配置数据集路径、权重路径与输出目录后,使用DeepSpeed多卡启动scripts/train.py执行微调。训练支持三种模式:音视频联合训练、仅视频训练、仅音频训练,开发者可基于InsAVE‑80K数据集二次微调以适配垂直业务场景。

常见问题与硬件建议

硬件配置与运行限制

官方未明确最小显存阈值,但作为大模型音视频联合方案,建议使用24GB及以上显存的NVIDIA显卡。显存不足易触发OOM,可开启梯度检查点降低占用。模型体量较大,CPU推理速度极慢,不具备实用价值,必须使用NVIDIA CUDA显卡。

音画同步与效果优化

若编辑后音画不同步,优先检查是否选用匹配任务的权重,台词编辑务必使用内容标记。源视频画面抖动剧烈或人物动作复杂时,模型对齐效果可能下降,补充更详细的文本指令可提升生成质量。

版权与商用说明

项目代码遵循Apache‑2.0协议,数据集使用约束需参考Hugging Face数据集主页说明。商用前请自行确认InsAVE‑80K数据集的版权合规性。

单模态编辑支持

若仅需修改音频而不改动画面,可在指令中明确要求保持画面不变,并搭配clone_id_voice权重,模型将优先更新音频台词部分。

来源:https://www.aipuzi.cn/ai-news/instructav2av.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。