跳到正文
原文
arXiv cs.AI· Zhaolong Su, Yujin Han, Feng Wang, Jameson Dong, Hins Hu, Difan Zou·· 4 小时前AI 评分33

CoRe:协同演化奖励模型,缓解视频扩散模型的隐空间奖励黑客问题

CoRe: Co-Evolving Reward Models for Mitigating Latent Reward Hacking in Video Diffusion Models

AI 导读

CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。

来源:arXiv cs.AI · arxiv.org