/documents/79715/
基本信息
文件基本信息
名称
MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
描述
我们建议使用一种新颖的多模态联合训练框架 MMAudio 在给定视频和可选文本条件下合成高质量和同步的音频。与仅以(有限)视频数据为条件的单模态训练相比,MMAudio 与更大规模、现成的文本音频数据联合训练,以学习生成语义对齐的高质量音频样本。此外,我们还通过条件同步模块改进了视听同步,该模块可在帧级别将视频条件与潜在音频保持一致。通过流匹配目标进行训练,MMAudio 在音频质量、语义对齐和视听同步方面在公共模型中实现了新的视频到音频最先进水平,同时具有较短的推理时间(1.23 秒生成 8 秒剪辑)和仅 157M 参数。 MMAudio 在文本到音频生成方面也取得了令人惊讶的竞争性能,这表明联合训练并不妨碍单模态性能。代码和演示可在以下位置获取:此 https URL ...