热点事件持续更新
研究称SFT泛化弱源于off-policy数据
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
2026年10月3日,AGI Hunt报道,Maxime Labonne引用一项研究指出,SFT(监督微调)泛化能力弱于RL(强化学习)的根源在于训练数据是off-policy的,而非SFT目标函数本身。研究显示,把专家轨迹改写成接近基座模型输出风格后,可达到甚至超越on-policy方法的效果,且遗忘更少。akarvonen补充称,on-policy训练的信噪比更高,只关注目标指标,不涉及语气、回复结构等无关维度,对模型的扰动更小。报道未披露该研究的具体实验设置与出处。
AI 根据报道生成 · 1 小时前更新
最新进展10月3日 11:07
Maxime Labonne指出SFT泛化弱源于off-policy数据,改写专家轨迹可媲美RL且遗忘更少。报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- AGI Hunt研究:SFT 泛化差源于 off-policy 数据,改写专家轨迹可媲美 RL
Maxime Labonne 引用研究指出,SFT 泛化能力弱于 RL 的根源在于数据是 off-policy 的,而非 SFT 目标函数本身。把专家轨迹改写成接近基座模型的输出风格,即可达到甚至超越 on-policy 方法,且遗忘更少。akarvonen 补充称,on-policy 训练信噪比更高,只关注目标指标,不涉及语气、回复结构等无关维度,对模型扰动更小。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。