跳到正文
热点事件持续更新

Soundwich:分层可控音频的视频生成框架

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,arXiv cs.CV 刊出 Soundwich,一个免训练的分层可控音频视频生成框架。它把冻结的联合音视频 flow-matching 模型改造成可生成多条音频 stem 的生成器,这些 stem 与同一视频同步,并可独立编辑。各 stem 支持显式控制时间活动,并借助共享场景表示维持全局音视频上下文的整体一致,可分别调整时间、静音、替换或重混。实验与人工评测显示,该方法在时间控制、音源分离和自然度上均有提升,代码已公开。目前除该篇报道外,尚无后续进展披露。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. arXiv cs.CV
    Soundwich:分层可控音频的视频生成框架

    Soundwich 提出一种免训练框架,可将冻结的联合音视频 flow-matching 模型改造成生成多条与同一视频同步、可独立编辑音频 stem 的生成器。各 stem 支持显式控制时间活动,并借助共享场景表示维持全局音视频上下文一致,可单独改时间、静音、替换或重混。实验与人工评测显示其时间控制、音源分离和自然度均有提升,代码已公开。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。