arXiv cs.CV· Zhuo Ning, AmirHossein Naghi Razlighi, Sagi Polaczek, Daniel Cohen-Or, Ali Mahdavi-Amiri·· 4 小时前AI 评分37
Soundwich:分层可控音频的视频生成框架
Soundwich: Video Generation with Layered and Controllable Audio
AI 导读
Soundwich 提出一种免训练框架,可将冻结的联合音视频 flow-matching 模型改造成生成多条与同一视频同步、可独立编辑音频 stem 的生成器。各 stem 支持显式控制时间活动,并借助共享场景表示维持全局音视频上下文一致,可单独改时间、静音、替换或重混。实验与人工评测显示其时间控制、音源分离和自然度均有提升,代码已公开。
来源:arXiv cs.CV · arxiv.org