跳到正文
原文
AGI Hunt· mittu1204·· 2 小时前AI 评分44

索尼 AI 开源 PAVAS:物理感知视频转音频模型入选 CVPR 2026 Oral

索尼 AI 开源 PAVAS:物理感知视频转音频模型入选 CVPR 2026 Oral

AI 导读

索尼 AI 将物理感知视频转音频模型 PAVAS 开源至 GitHub,该模型已被 CVPR 2026 接收为 Oral 报告。PAVAS 是 MMAudio(CVPR 2025)的演进版,通过质量、速度、分割与 patch 级视觉特征构建以物体为中心的条件信息,使生成音频更贴合视频中的物理互动。

来源:AGI Hunt · agihunt.info