跳到正文
热点事件持续更新

研究者提出采样重写数据让SFT媲美RL后训练

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月2日,AGI Hunt 报道,研究者 aakaran31 发现,把此前主要用于推理的「采样」引入后训练流程,可让 SFT 重新与主流后训练方法抗衡。其具体做法是重写训练数据,只在真正重要处优化「惊喜度」(surprise),从而为反向传播提供更干净信号。据称该方案泛化常常更好、遗忘更少,效果优于 RL 与 OPSD。转发者 mayfer 补充称,重写后数据的信噪比更高。目前该发现仍主要在社交平台传播,报道中未给出更细的复现步骤或评测数据。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月2日
  1. AGI Hunt
    SFT 未死:引入采样重写训练数据,效果可比 RL 后训练

    研究者 aakaran31 发现,把此前用于推理的「采样」引入后训练流程,可让 SFT 重新与主流后训练方法抗衡,泛化常常更好、遗忘更少,优于 RL 与 OPSD。做法是重写训练数据,只在真正重要处优化「惊喜度」(surprise),为反向传播提供更干净信号。转发者 mayfer 补充,重写后数据的信噪比更高。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。