AGI Hunt· ceciletamura·· 10 小时前AI 评分43
CMU 提出 TailRL:优化奖励上尾概率,让 RL 少陷次优解
AI 导读
CMU 团队在 arXiv 发表 TailRL,最大化策略超过随机选定奖励阈值的对数概率以优化奖励上尾。该方法只需修改优势函数,可解释为 Best-of-k 梯度的混合,兼容现有 RL 训练流程。在物体定位、迷宫导航、GUI grounding、代码优化等任务上,TailRL 利用稀有高奖励训练样本避免陷入次优解,且更受益于推理时增加采样。
来源:AGI Hunt · agihunt.info