热点事件持续更新
训练者复盘SFT-souping-RL交替训练配方
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月7日,AGI Hunt 报道,训练实践者 @tensorqt 复盘自己的 RL(强化学习)训练过程。他表示,回看整个训练,认为自己本可以做得更多 SFT(监督微调);同时他发现,交替使用 SFT、模型 souping 与 RL,能够形成不错的探索与利用循环。他还提到,训练曲线看起来混乱,部分原因是它确实乱。报道未披露具体的训练配置、数据规模或复现结果,目前公开信息仅为其个人复盘结论。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
10月7日
- AGI Hunt训练实践者 @tensorqt 复盘 RL 训练:交替使用 SFT-model souping-RL 是不错的探索-利用循环
训练实践者 @tensorqt 复盘自己的 RL 训练,回看认为本可以做得更多 SFT,并发现交替使用 SFT、模型 souping 与 RL 能形成不错的探索与利用循环。他还提到训练曲线看起来混乱,部分原因是它确实乱。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。