热点事件持续更新
CoRe:协同演化奖励模型缓解视频扩散奖励黑客
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年9月30日,arXiv cs.AI 刊出论文 CoRe,针对视频扩散模型对齐中的隐空间奖励黑客(latent reward hacking)问题提出协同演化奖励模型框架。该工作指出,生成器在数百步更新后即脱离奖励模型的训练分布,造成奖励分数虚高,而画面与运动质量反而下滑。CoRe 的做法是持续在生成器当前样本上重新拟合奖励模型,并以真实视频偏好作为锚定,使奖励模型与生成器协同演化。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。该事件目前仅有这一篇报道,尚无后续进展,也不存在前后数据或说法不一致的情况。
AI 根据报道生成 · 3 小时前更新
最新进展9月30日 12:00
CoRe 论文公开,其在 Wan2.1-T2V-1.3B 上生成质量优于预训练模型与既有对齐方法。报道时间线
沿着报道,了解事件的不同侧面。
9月30日
- arXiv cs.AICoRe:协同演化奖励模型,缓解视频扩散模型的隐空间奖励黑客问题
CoRe 用协同演化奖励框架缓解视频扩散模型的 latent reward hacking:生成器数百步更新后即脱离奖励模型训练分布,奖励虚高而画面与运动质量下滑。CoRe 持续在生成器当前样本上重拟合奖励模型,并以真实视频偏好锚定。在 Wan2.1-T2V-1.3B 上,其生成质量优于预训练模型和既有对齐方法。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。