AGI Hunt· tensorqt·· 4 小时前AI 评分28
训练实践者 @tensorqt 复盘 RL 训练:交替使用 SFT-model souping-RL 是不错的探索-利用循环
训练实践者复盘:SFT-souping-RL 交替是不错的探索-利用循环
AI 导读
训练实践者 @tensorqt 复盘自己的 RL 训练,回看认为本可以做得更多 SFT,并发现交替使用 SFT、模型 souping 与 RL 能形成不错的探索与利用循环。他还提到训练曲线看起来混乱,部分原因是它确实乱。
来源:AGI Hunt · agihunt.info