热点事件持续更新
研究者提出采样重写数据让SFT媲美RL后训练
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月2日,AGI Hunt 报道,研究者 aakaran31 发现,把此前主要用于推理的「采样」引入后训练流程,可让 SFT 重新与主流后训练方法抗衡。其具体做法是重写训练数据,只在真正重要处优化「惊喜度」(surprise),从而为反向传播提供更干净信号。据称该方案泛化常常更好、遗忘更少,效果优于 RL 与 OPSD。转发者 mayfer 补充称,重写后数据的信噪比更高。目前该发现仍主要在社交平台传播,报道中未给出更细的复现步骤或评测数据。
AI 根据报道生成 · 2 小时前更新
最新进展10月2日 23:20
aakaran31 称将采样引入后训练并重写数据,可让 SFT 媲美 RL,泛化更好、遗忘更少。报道时间线
沿着报道,了解事件的不同侧面。
10月2日
- AGI HuntSFT 未死:引入采样重写训练数据,效果可比 RL 后训练
研究者 aakaran31 发现,把此前用于推理的「采样」引入后训练流程,可让 SFT 重新与主流后训练方法抗衡,泛化常常更好、遗忘更少,优于 RL 与 OPSD。做法是重写训练数据,只在真正重要处优化「惊喜度」(surprise),为反向传播提供更干净信号。转发者 mayfer 补充,重写后数据的信噪比更高。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。