跳到正文
原文
AGI Hunt· tensorqt·· 3 小时前AI 评分26

研究者 tensorqt:RL 熵坍缩无高效解法,59 步 SFT 可回注探索能量

研究者称 RL 熵坍缩无高效解法

AI 导读

研究者 tensorqt 提出,RL 训练中的熵坍缩(模式坍缩)不存在清晰的样本高效修复方法,应把坍缩看作模型可消耗的「势能」而非直接修复。他认为模型在 RL 中学会跨模式采样的代价是丧失探索能力,可通过 SFT 回注探索能量,例如以 59 步 SFT 为模型重新注入探索能力。

来源:AGI Hunt · agihunt.info