跳到正文
原文
arXiv cs.CV· Duowen Chen, Jinjin He, Gouthaman KV, Sandeep Bangalore Venkatesh, Bo Zhu·· 8 小时前AI 评分46

Audible World Models:面向 3D 世界的空间感知声音生成

Audible World Models: Spatially Aware Sound Generation for 3D Worlds

AI 导读

Audible World Models 是一个无需训练的框架,将声音整合进生成式 3D 世界状态:从文本提示构建全景 3D 代理,分离语义层并识别发声物体与环境背景,再把音频锚定到重建几何,用几何声学传播渲染随听者视角与移动变化的空间音频。在 80 个生成场景中,其空间一致性显著优于 text、video 和全景条件基线,VLM 与人工评估也更偏好其视听一致性与空间合理性。

来源:arXiv cs.CV · arxiv.org