AGI Hunt· Ashok Prasad Neupane·· 2 小时前AI 评分36
iADD 从理论上修正 DDPO:仅更新后段时间步反而损害多样性
iADD 从理论上修正 DDPO:仅更新后段时间步反而损害多样性
AI 导读
iADD 通过数学分析证明,扩散模型强化学习后训练(如 DDPO)仅对后段时间步做更新反而会损害生成多样性,与既有工作的结论相反。该方法基于 Feynman-Kac 做增量训练,在对齐与多样性之间取得迄今最佳权衡,并在三个任务的对比与消融中验证了对齐和多样性两方面的性能提升。
来源:AGI Hunt · agihunt.info