跳到正文
原文
AGI Hunt· meituan·· 6 小时前AI 评分44

美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%

美团 TGRL:温度分组强化学习,RLVR 训练速度提升最高 36%

AI 导读

美团提出 TGRL(温度分组强化学习),把温度带来的 rollout 多样性转为显式训练信号,解决 RLVR 探索效率瓶颈:每个 prompt 的 rollout 组按温度分为低/高两个子集,用奖励对比估计探索增益,再以 JS 散度分配为 token 级 credit。不扩大 rollout 预算下,达到同等精度最高快 36%,代码已开源。

来源:AGI Hunt · agihunt.info