跳到正文
热点事件持续更新

索尼AI开源PAVAS:物理感知视频转音频

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 3 日,索尼 AI 将物理感知视频转音频模型 PAVAS 开源至 GitHub,并披露该模型已被 CVPR 2026 接收为 Oral 报告。据 AGI Hunt 报道,PAVAS 是 MMAudio(CVPR 2025)的演进版本,通过质量、速度、分割与 patch 级视觉特征构建以物体为中心的条件信息,使生成的音频更贴合视频中的物理互动。目前公开信息集中于开源与论文被 CVPR 2026 接收为 Oral 两点,报道未披露模型规模、训练数据、评测指标等更多技术细节,也尚无第三方复现或使用反馈。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. AGI Hunt
    索尼 AI 开源 PAVAS:物理感知视频转音频模型入选 CVPR 2026 Oral

    索尼 AI 将物理感知视频转音频模型 PAVAS 开源至 GitHub,该模型已被 CVPR 2026 接收为 Oral 报告。PAVAS 是 MMAudio(CVPR 2025)的演进版,通过质量、速度、分割与 patch 级视觉特征构建以物体为中心的条件信息,使生成音频更贴合视频中的物理互动。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。