AGI Hunt· mayfer·· 4 小时前AI 评分44
SFT 未死:引入采样重写训练数据,效果可比 RL 后训练
AI 导读
研究者 aakaran31 发现,把此前用于推理的「采样」引入后训练流程,可让 SFT 重新与主流后训练方法抗衡,泛化常常更好、遗忘更少,优于 RL 与 OPSD。做法是重写训练数据,只在真正重要处优化「惊喜度」(surprise),为反向传播提供更干净信号。转发者 mayfer 补充,重写后数据的信噪比更高。
来源:AGI Hunt · agihunt.info