- 月流量
- 0
- 产品收费
- 免费和付费
- 收录时间
- 2026-08-06
- 更新时间
- 2026-08-06
01InstructAV2AV是什么
InstructAV2AV 是北京智源人工智能研究院与北京大学联合推出的音视频联合编辑模型。用户只需一句自然语言指令,可在端到端生成过程中同时编辑视频画面与对应声音,无需手工掩码或分步处理。模型支持台词修改、人物替换、对象插入与删除,能保持背景与环境声不变,维持声画时间同步。
02InstructAV2AV的主要功能
身份保持的语音修改:在保留人物形象的前提下只替换其说话内容。
音视频实例替换:把画面中的指定人物连同其声音和台词一起更换。
实例插入:向画面添加新对象并自动生成与之同步的声音。
实例移除:删除指定对象及其在音轨中的对应声音。
属性组合编辑:人物外观、说话内容和音色可分别独立修改并自由组合。
03InstructAV2AV的技术原理
微信关注回复“开源”,加入AI开源项目交流群
源潜变量拼接:将源视频与源音频的潜变量与噪声沿通道维度拼接,使源内容成为整个去噪过程的结构条件,约束模型保留背景、无关对象和环境声,避免”改一个目标、重绘整个世界”。
SIGA 门控注意力:Source-Instruction Gated Attention 让每个 token 同时与源特征和指令特征交互,通过可学习的软门控逐位置决定改多少、留多少,实现内容保留与指令执行的动态平衡。
双流交互架构:基于 Ovi 对称双流扩散 Transformer,视频与音频分支各自自注意力建模后,通过双向跨模态注意力交换特征,使视觉运动与声音事件相互约束、保持同步。
两阶段训练:关闭跨模态注意力分别训练单模态编辑能力,再恢复完整架构联合微调,学习声画之间的细粒度对应关系。
自动化数据流水线:通过素材筛选、编辑目标合成、五维自动评估加人工复核三阶段构建 InsAVE-80K 数据集,解决成对训练数据稀缺问题。
04如何使用InstructAV2AV
克隆代码:从 GitHub 克隆 InstructAV2AV 代码仓库到本地。
配置环境:按照仓库说明配置 Python 环境并安装所需依赖。
下载权重:从 Hugging Face 下载 InstructAV2AV 模型权重。
准备素材:准备一段带声音的视频素材作为输入。
输入指令:输入一句自然语言编辑指令,描述想要修改的内容。
运行推理:运行推理脚本,等待模型生成编辑后的视频与音频。
保存结果:查看输出结果并保存编辑完成的音视频文件。
05InstructAV2AV的项目地址
项目官网:https://hjzheng.net/projects/InstructAV2AV/
GitHub仓库:https://github.com/suimuc/InstructAV2AV
HuggingFace模型库:https://huggingface.co/suimu/InstructAV2AV
arXiv技术论文:https://arxiv.org/pdf/2605.18467
06InstructAV2AV的应用场景
影视后期:影视后期人员用它替换演员台词并同步口型,降低补拍成本。
短视频制作:短视频创作者用它一句话修改素材中的人物与声音,提升创作效率。
虚拟人:虚拟人运营团队用它调整数字人的外观、音色与说话内容。
广告创意:广告从业者用它批量生成不同人物与台词版本的宣传视频。
交互式内容生产:游戏与教育工作者用它动态生成音画一致的多媒体素材。
© 免责声明:鉴于域名具有时效性,指向的网站内容可能发生变更。AIEZZ对呈现的第三方网站不可控,无法承担任何责任。请自行判断内容风险。


用户评价0