热点事件持续更新
Audible World Models 空间音频生成框架
1 篇报道1 个报道来源7 小时前更新
先了解这件事
AI 综述
2026 年 10 月 1 日,arXiv cs.CV 刊出一篇题为 Audible World Models 的论文,提出一个面向 3D 世界的空间感知声音生成框架,用于把声音整合进生成式 3D 世界状态。该框架无需训练:先从文本提示构建全景 3D 代理,分离语义层并识别发声物体与环境背景,再把音频锚定到重建几何上,最终借助几何声学传播渲染出随听者视角与移动而变化的空间音频。评估方面,论文在 80 个生成场景中报告其空间一致性显著优于文本、视频与全景条件基线,VLM 评估与人工评估也更偏好该框架的视听一致性与空间合理性。目前事件仅有这一篇报道,尚无后续进展或其他来源的独立验证。
AI 根据报道生成 · 58 分钟前更新
最新进展10月1日 12:00
arXiv 发布 Audible World Models,无需训练即可渲染随听者视角变化的空间音频。报道时间线
沿着报道,了解事件的不同侧面。
10月1日
- arXiv cs.CVAudible World Models:面向 3D 世界的空间感知声音生成
Audible World Models 是一个无需训练的框架,将声音整合进生成式 3D 世界状态:从文本提示构建全景 3D 代理,分离语义层并识别发声物体与环境背景,再把音频锚定到重建几何,用几何声学传播渲染随听者视角与移动变化的空间音频。在 80 个生成场景中,其空间一致性显著优于 text、video 和全景条件基线,VLM 与人工评估也更偏好其视听一致性与空间合理性。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。