AGI Hunt· tensorqt·· 3 小时前AI 评分26
研究者 tensorqt:RL 熵坍缩无高效解法,59 步 SFT 可回注探索能量
研究者称 RL 熵坍缩无高效解法
AI 导读
研究者 tensorqt 提出,RL 训练中的熵坍缩(模式坍缩)不存在清晰的样本高效修复方法,应把坍缩看作模型可消耗的「势能」而非直接修复。他认为模型在 RL 中学会跨模式采样的代价是丧失探索能力,可通过 SFT 回注探索能量,例如以 59 步 SFT 为模型重新注入探索能力。
来源:AGI Hunt · agihunt.info