跳到正文
热点事件持续更新

iADD 从理论上修正 DDPO:后段更新损害多样性

1 篇报道1 个报道来源1 小时前更新

先了解这件事

AI 综述

围绕扩散模型强化学习后训练中「只更新后段时间步更有利」这一既有结论,iADD 给出了相反的理论结论。2026 年 10 月 7 日的报道显示,iADD 通过数学分析证明,对扩散模型做强化学习后训练(如 DDPO)时,仅对后段时间步进行更新反而会损害生成多样性——这与既有工作的结论相反。在方法上,iADD 基于 Feynman-Kac 做增量训练,目标是在对齐与多样性之间取得迄今最好的权衡。报道称,该方法在三个任务的对比与消融实验中,于对齐和多样性两方面均验证了提升。目前公开信息集中于该理论与方法的提出及实验验证,尚无更多后续进展披露。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. AGI Hunt
    iADD 从理论上修正 DDPO:仅更新后段时间步反而损害多样性

    iADD 通过数学分析证明,扩散模型强化学习后训练(如 DDPO)仅对后段时间步做更新反而会损害生成多样性,与既有工作的结论相反。该方法基于 Feynman-Kac 做增量训练,在对齐与多样性之间取得迄今最佳权衡,并在三个任务的对比与消融中验证了对齐和多样性两方面的性能提升。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。