热点事件持续更新
Soundwich:分层可控音频的视频生成框架
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,arXiv cs.CV 刊出 Soundwich,一个免训练的分层可控音频视频生成框架。它把冻结的联合音视频 flow-matching 模型改造成可生成多条音频 stem 的生成器,这些 stem 与同一视频同步,并可独立编辑。各 stem 支持显式控制时间活动,并借助共享场景表示维持全局音视频上下文的整体一致,可分别调整时间、静音、替换或重混。实验与人工评测显示,该方法在时间控制、音源分离和自然度上均有提升,代码已公开。目前除该篇报道外,尚无后续进展披露。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 12:00
Soundwich 免训练框架发布,可将冻结音视频模型改造为多条可独立编辑音频 stem 的生成器。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- arXiv cs.CVSoundwich:分层可控音频的视频生成框架
Soundwich 提出一种免训练框架,可将冻结的联合音视频 flow-matching 模型改造成生成多条与同一视频同步、可独立编辑音频 stem 的生成器。各 stem 支持显式控制时间活动,并借助共享场景表示维持全局音视频上下文一致,可单独改时间、静音、替换或重混。实验与人工评测显示其时间控制、音源分离和自然度均有提升,代码已公开。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。