AGI Hunt· meituan·· 6 小时前AI 评分44
美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%
美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%
AI 导读
美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。
来源:AGI Hunt · agihunt.info