AGI Hunt· mittu1204·· 2 小时前AI 评分44
索尼 AI 开源 PAVAS:物理感知视频转音频模型入选 CVPR 2026 Oral
索尼 AI 开源 PAVAS:物理感知视频转音频模型入选 CVPR 2026 Oral
AI 导读
索尼 AI 将物理感知视频转音频模型 PAVAS 开源至 GitHub,该模型已被 CVPR 2026 接收为 Oral 报告。PAVAS 是 MMAudio(CVPR 2025)的演进版,通过质量、速度、分割与 patch 级视觉特征构建以物体为中心的条件信息,使生成音频更贴合视频中的物理互动。
来源:AGI Hunt · agihunt.info